Skip to Content

Свои серверы

Кроме OpenRouter, можно добавить своих провайдеров: сервер моделей на вашем компьютере или в вашей сети — LM Studio, Ollama, Unsloth Studio, llama.cpp, vLLM — или любой удалённый API в формате OpenAI или Anthropic. Агенты тогда работают на модели из списка этого сервера.

1. Добавьте сервер

Настройки → Провайдеры → Ваши провайдеры → Добавить провайдера

Выберите Сервер, который у вас запущен: для LM Studio, Ollama, Unsloth Studio, llama.cpp и vLLM подставятся их обычные адрес и порт. Другой или удалённый — для всего остального.

Проверьте адрес

Имя, Протокол (http или https), Хост (localhost, IP-адрес или api.example.com — без http:// и без порта), Порт. Путь — только если сервер отдаёт API по подпути, например /api. API-ключ — только если сервер его требует.

Проверить соединение

NeuroSquad читает список моделей сервера и сам определяет, на каких API тот говорит, и показывает результат: на каком API говорит сервер (OpenAI, Anthropic или оба), с какими CLI агентов он работает и сколько на нём моделей. Модели эмбеддингов скрыты.

Сохранить

Провайдера можно сохранить только после успешной проверки. Изменили поле — проверьте снова.

API выбирать не нужно — это делает проверка. Сервер, на котором ещё не загружена ни одна модель, всё равно можно сохранить: загрузите модель, а потом нажмите Обновить список моделей.

Ключ, если вы его указали, шифруется средствами операционной системы и передаётся только агентам, работающим на этом провайдере, — никогда не в командную строку и не в файлы. Провайдер без ключа никогда не переключается на ваш собственный вход в Claude или OpenAI: NeuroSquad передаёт CLI ключ-заглушку.

В списке каждый провайдер помечен как локальный (этот компьютер или ваша домашняя/офисная сеть) или удалённый, с адресом, API, числом моделей и отметкой, сохранён ли ключ.

2. Переведите на него агента

При создании агента (New agent… в меню добавления) или позже в меню ⋯ карточки → Provider and model выберите свой сервер в группе Ваши провайдеры и Модель из его списка. Изменение вступает в силу при следующем запуске агента. Чип на карточке показывает провайдера и модель.

Какие CLI агентов могут им пользоваться

CLI агентаЧто нужно на сервере
Claude CodeAnthropic API (/v1/messages)
Codex CLIOpenAI API — через переводчик NeuroSquad, если у сервера нет Responses API (ниже)
Qwen CodeOpenAI API
Gemini CLIOpenAI API, через небольшой переводчик, который NeuroSquad запускает на вашем компьютере
OpenCode, Kilo Code, Hermes Agent, Kimi Code, Pi, omp, Crush, Factory Droid, Cline CLI, aider, GitHub Copilot CLI, GooseЛюбой из двух API
Cursor CLI, Amp, AuggieНе могут — их модели работают только на серверах их разработчиков

Многие локальные серверы говорят на обоих API на одном порту, так что ими может пользоваться любой CLI из таблицы. Если удалить провайдера, его агенты работают на собственном входе своего CLI, пока вы не выберете другого; карточка об этом сообщает.

Codex CLI на серверах без Responses API

Codex CLI говорит только на Responses API от OpenAI, а большинство локальных серверов — LM Studio, llama.cpp, vLLM, Ollama — и многие удалённые дают только Chat Completions. С таким сервером NeuroSquad запускает на вашем компьютере небольшой переводчик между Codex и сервером, и Codex работает и там. Настраивать ничего не нужно: у провайдера Codex CLI просто появляется в списке «Работает с».

  • Ключ вашего сервера остаётся внутри NeuroSquad; Codex получает только пропуск к переводчику, свой для каждой карточки.
  • Счётчики токенов — собственные числа сервера, передаются без изменений.
  • Встроенный веб-поиск Codex так недоступен, а изображения в результатах инструментов доходят до модели заглушкой.

Сервер, у которого Responses API есть, используется напрямую.

Окно контекста

CLI агентов не знают, сколько контекста у модели на вашем сервере: Claude Code считает, что 200K токенов, а OpenCode без этого числа вообще не сжимает разговор. Длинная сессия тогда перерастает окно сервера и заканчивается ошибкой.

Если список моделей сервера сообщает, с каким окном контекста он отдаёт модель (n_ctx у llama.cpp, max_model_len у vLLM или поле context_length, как у LM Studio и других), NeuroSquad передаёт его дальше:

  • Claude Code — окно и ограничение ответа: 32K токенов или четверть окна, что меньше.
  • Codex CLI — окно и автоматическое сжатие на 85% от него.
  • OpenCode — окно и то же ограничение ответа, чтобы он вовремя сжимал разговор.

Если сервер окно не сообщает, запускайте его с тем размером контекста, в котором должны работать агенты, или держите сессии короче и пользуйтесь Compact.

Стоимость

У моделей на вашем сервере нет прайсовой цены. Их токены учитываются в разделе Расход и стоимость, если CLI агента их записывает, а стоимость показывается как без цены — никогда не $0. Если локальный сервер не присылает счётчики кеша, они показаны как не сообщается, а не 0.

Небольшие локальные модели могут не справляться с инструментами некоторых CLI — особенно Claude Code, который сделан под модели Anthropic. Если агент застревает или неправильно вызывает инструменты, попробуйте модель побольше или CLI, рассчитанный на открытые модели, например OpenCode или Qwen Code.