⟵ Все статьи
Читать на:

Как установить локальную AI-модель на удалённый сервер

Как установить локальную AI-модель на удалённый сервер

Запускать языковые модели локально на ноутбуке удобно для экспериментов, но быстро упирается в ограничения железа. Удалённый VPS-сервер снимает эту проблему: вы получаете выделенные ресурсы, постоянную доступность и возможность обращаться к модели через API из любого приложения. В этой статье разберём полный путь — от заказа сервера до запуска инференса с помощью Ollama, одного из самых популярных инструментов для self-hosted LLM.

Шаг 1. Создаём сервер в NodexGo

Перейдите в панель NodexGo и нажмите кнопку «Создать сервер». Сначала выберите локацию — рядом с каждым дата-центром отображается реальный пинг от вашего браузера, что помогает выбрать ближайшую точку для минимальной задержки при обращении к API модели. Затем выберите тариф: для запуска небольших моделей (7B параметров) достаточно 8–16 ГБ оперативной памяти, для моделей покрупнее потребуется больше RAM и CPU-ядер.

В качестве образа операционной системы выберите Ubuntu 24.04 — на ней лучше всего протестирована совместимость с Ollama и большинством ML-инструментов. Задайте имя сервера, выберите период оплаты (1, 3, 6 или 12 месяцев) и подтвердите заказ. Примерно через минуту сервер будет готов: IP-адрес и пароль root появятся в панели и придут на почту.

Запустите свой AI-сервер за минуту

Создать сервер

Шаг 2. Подключаемся по SSH и обновляем систему

Когда сервер готов, подключитесь к нему по SSH, используя IP-адрес из панели и пароль root, который пришёл на почту. Если по какой-то причине SSH-соединение не устанавливается, воспользуйтесь web-консолью VNC прямо в карточке сервера — она доступна без дополнительных настроек и спасает в нештатных ситуациях.

ssh root@IP-адрес-сервера

После входа первым делом обновите пакеты системы, чтобы получить актуальные версии зависимостей и закрыть возможные уязвимости.

apt update && apt upgrade -y

Шаг 3. Устанавливаем Ollama

Ollama — это инструмент, который упаковывает языковые модели вместе со всеми зависимостями и предоставляет простой REST API для инференса. Он поддерживает десятки открытых моделей: Llama 3, Mistral, Gemma, Phi и другие. Установка выполняется одной командой — официальный скрипт сам определит архитектуру системы и установит нужные компоненты.

curl -fsSL https://ollama.com/install.sh | sh

После установки Ollama автоматически регистрируется как systemd-сервис и запускается в фоне. Проверить статус можно стандартной командой systemctl. По умолчанию API доступен на порту 11434 только на loopback-интерфейсе — это разумное поведение с точки зрения безопасности, и мы разберём, как открыть доступ снаружи, чуть позже.

systemctl status ollama

Шаг 4. Скачиваем и запускаем модель

Команда ollama pull загружает модель из официального реестра и сохраняет её на диск сервера. Для первого запуска рекомендуем взять Mistral 7B — хорошее соотношение качества и потребления ресурсов. Размер модели около 4 ГБ, поэтому убедитесь заранее, что на диске достаточно места.

ollama pull mistral

После загрузки можно сразу пообщаться с моделью в интерактивном режиме прямо в терминале, чтобы убедиться, что всё работает корректно.

ollama run mistral

Шаг 5. Открываем API для внешних запросов

По умолчанию Ollama слушает только localhost. Чтобы обращаться к API с вашего компьютера или из стороннего приложения, нужно изменить переменную окружения OLLAMA_HOST. Откройте файл конфигурации systemd-юнита для редактирования.

systemctl edit ollama

В открывшемся редакторе добавьте секцию Service с переменной окружения, которая указывает Ollama слушать на всех интерфейсах.

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"

Сохраните файл и перезапустите сервис. После этого API будет доступен по внешнему IP-адресу сервера на порту 11434. Обязательно ограничьте доступ к этому порту через firewall — разрешите подключения только с доверенных IP-адресов, иначе любой желающий сможет использовать вашу модель и нагружать сервер.

systemctl daemon-reload
systemctl restart ollama
ufw allow from ВАШ_IP to any port 11434
ufw enable

Шаг 6. Проверяем API и делаем первый запрос

Ollama предоставляет REST API, совместимый с форматом OpenAI. Это означает, что большинство библиотек и инструментов, написанных под OpenAI, будут работать с вашей локальной моделью без изменений — достаточно поменять базовый URL. Проверим работу API через curl, отправив простой запрос на генерацию текста.

curl http://IP-адрес-сервера:11434/api/generate \
  -d '{"model": "mistral", "prompt": "Привет! Кто ты?", "stream": false}'

Если в ответе вернулся JSON с полем response — модель работает и готова принимать запросы. Теперь вы можете подключить её к своему приложению, чат-боту, системе RAG или любому другому инструменту, который умеет работать с HTTP API.

Масштабирование и управление сервером

Если со временем вам понадобятся более мощные модели или вырастет нагрузка, не придётся мигрировать на новый сервер с нуля. В панели NodexGo доступна кнопка «Увеличить мощности» — она переводит сервер на старший тариф с сохранением диска, всех данных и IP-адреса. Ollama и скачанные модели останутся на месте, потребуется только перезапуск сервиса.

Для удобного управления несколькими моделями и мониторинга запросов можно дополнительно установить Open WebUI — веб-интерфейс, который работает поверх Ollama и предоставляет удобный чат-интерфейс, историю диалогов и управление моделями. Это особенно полезно, если сервером пользуется команда. Также не забывайте периодически обновлять сами модели командой ollama pull — разработчики регулярно выпускают улучшенные версии.

Заключение

Развернуть собственную языковую модель на удалённом сервере проще, чем кажется: Ollama берёт на себя всю сложность упаковки зависимостей, а VPS даёт стабильные ресурсы и постоянный доступ к API. Вы получаете полный контроль над данными, отсутствие лимитов на запросы и возможность использовать любые открытые модели без привязки к внешним сервисам. Арендуйте подходящий сервер на NodexGo, выберите модель по вкусу — и ваш персональный AI-ассистент будет готов к работе меньше чем за час.

Разверните AI-модель на своём VPS уже сегодня

Арендовать сервер

Мы используем файлы cookie: необходимые — для входа в аккаунт и языка интерфейса, аналитические — чтобы понимать, какими страницами пользуются. Сторонних рекламных систем у нас нет. Подробнее