Как установить локальную AI-модель на удалённый сервер

Запускать языковые модели локально на ноутбуке удобно для экспериментов, но быстро упирается в ограничения железа. Удалённый VPS-сервер снимает эту проблему: вы получаете выделенные ресурсы, постоянную доступность и возможность обращаться к модели через API из любого приложения. В этой статье разберём полный путь — от заказа сервера до запуска инференса с помощью Ollama, одного из самых популярных инструментов для self-hosted LLM.
Шаг 1. Создаём сервер в NodexGo
Перейдите в панель NodexGo и нажмите кнопку «Создать сервер». Сначала выберите локацию — рядом с каждым дата-центром отображается реальный пинг от вашего браузера, что помогает выбрать ближайшую точку для минимальной задержки при обращении к API модели. Затем выберите тариф: для запуска небольших моделей (7B параметров) достаточно 8–16 ГБ оперативной памяти, для моделей покрупнее потребуется больше RAM и CPU-ядер.
В качестве образа операционной системы выберите Ubuntu 24.04 — на ней лучше всего протестирована совместимость с Ollama и большинством ML-инструментов. Задайте имя сервера, выберите период оплаты (1, 3, 6 или 12 месяцев) и подтвердите заказ. Примерно через минуту сервер будет готов: IP-адрес и пароль root появятся в панели и придут на почту.
Запустите свой AI-сервер за минуту
Создать серверШаг 2. Подключаемся по SSH и обновляем систему
Когда сервер готов, подключитесь к нему по SSH, используя IP-адрес из панели и пароль root, который пришёл на почту. Если по какой-то причине SSH-соединение не устанавливается, воспользуйтесь web-консолью VNC прямо в карточке сервера — она доступна без дополнительных настроек и спасает в нештатных ситуациях.
ssh root@IP-адрес-сервераПосле входа первым делом обновите пакеты системы, чтобы получить актуальные версии зависимостей и закрыть возможные уязвимости.
apt update && apt upgrade -yШаг 3. Устанавливаем Ollama
Ollama — это инструмент, который упаковывает языковые модели вместе со всеми зависимостями и предоставляет простой REST API для инференса. Он поддерживает десятки открытых моделей: Llama 3, Mistral, Gemma, Phi и другие. Установка выполняется одной командой — официальный скрипт сам определит архитектуру системы и установит нужные компоненты.
curl -fsSL https://ollama.com/install.sh | shПосле установки Ollama автоматически регистрируется как systemd-сервис и запускается в фоне. Проверить статус можно стандартной командой systemctl. По умолчанию API доступен на порту 11434 только на loopback-интерфейсе — это разумное поведение с точки зрения безопасности, и мы разберём, как открыть доступ снаружи, чуть позже.
systemctl status ollamaШаг 4. Скачиваем и запускаем модель
Команда ollama pull загружает модель из официального реестра и сохраняет её на диск сервера. Для первого запуска рекомендуем взять Mistral 7B — хорошее соотношение качества и потребления ресурсов. Размер модели около 4 ГБ, поэтому убедитесь заранее, что на диске достаточно места.
ollama pull mistralПосле загрузки можно сразу пообщаться с моделью в интерактивном режиме прямо в терминале, чтобы убедиться, что всё работает корректно.
ollama run mistralШаг 5. Открываем API для внешних запросов
По умолчанию Ollama слушает только localhost. Чтобы обращаться к API с вашего компьютера или из стороннего приложения, нужно изменить переменную окружения OLLAMA_HOST. Откройте файл конфигурации systemd-юнита для редактирования.
systemctl edit ollamaВ открывшемся редакторе добавьте секцию Service с переменной окружения, которая указывает Ollama слушать на всех интерфейсах.
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"Сохраните файл и перезапустите сервис. После этого API будет доступен по внешнему IP-адресу сервера на порту 11434. Обязательно ограничьте доступ к этому порту через firewall — разрешите подключения только с доверенных IP-адресов, иначе любой желающий сможет использовать вашу модель и нагружать сервер.
systemctl daemon-reload
systemctl restart ollama
ufw allow from ВАШ_IP to any port 11434
ufw enableШаг 6. Проверяем API и делаем первый запрос
Ollama предоставляет REST API, совместимый с форматом OpenAI. Это означает, что большинство библиотек и инструментов, написанных под OpenAI, будут работать с вашей локальной моделью без изменений — достаточно поменять базовый URL. Проверим работу API через curl, отправив простой запрос на генерацию текста.
curl http://IP-адрес-сервера:11434/api/generate \
-d '{"model": "mistral", "prompt": "Привет! Кто ты?", "stream": false}'Если в ответе вернулся JSON с полем response — модель работает и готова принимать запросы. Теперь вы можете подключить её к своему приложению, чат-боту, системе RAG или любому другому инструменту, который умеет работать с HTTP API.
Масштабирование и управление сервером
Если со временем вам понадобятся более мощные модели или вырастет нагрузка, не придётся мигрировать на новый сервер с нуля. В панели NodexGo доступна кнопка «Увеличить мощности» — она переводит сервер на старший тариф с сохранением диска, всех данных и IP-адреса. Ollama и скачанные модели останутся на месте, потребуется только перезапуск сервиса.
Для удобного управления несколькими моделями и мониторинга запросов можно дополнительно установить Open WebUI — веб-интерфейс, который работает поверх Ollama и предоставляет удобный чат-интерфейс, историю диалогов и управление моделями. Это особенно полезно, если сервером пользуется команда. Также не забывайте периодически обновлять сами модели командой ollama pull — разработчики регулярно выпускают улучшенные версии.
Заключение
Развернуть собственную языковую модель на удалённом сервере проще, чем кажется: Ollama берёт на себя всю сложность упаковки зависимостей, а VPS даёт стабильные ресурсы и постоянный доступ к API. Вы получаете полный контроль над данными, отсутствие лимитов на запросы и возможность использовать любые открытые модели без привязки к внешним сервисам. Арендуйте подходящий сервер на NodexGo, выберите модель по вкусу — и ваш персональный AI-ассистент будет готов к работе меньше чем за час.
Разверните AI-модель на своём VPS уже сегодня
Арендовать сервер