Свои серверы
Кроме OpenRouter, можно добавить своих провайдеров: сервер моделей на вашем компьютере или в вашей сети — LM Studio, Ollama, Unsloth Studio, llama.cpp, vLLM — или любой удалённый API в формате OpenAI или Anthropic. Агенты тогда работают на модели из списка этого сервера.
1. Добавьте сервер
Выберите Сервер, который у вас запущен: для LM Studio, Ollama, Unsloth Studio, llama.cpp и vLLM подставятся их обычные адрес и порт. Другой или удалённый — для всего остального.
Имя, Протокол (http или https), Хост (localhost, IP-адрес или api.example.com —
без http:// и без порта), Порт. Путь — только если сервер отдаёт API по подпути,
например /api. API-ключ — только если сервер его требует.
NeuroSquad читает список моделей сервера и сам определяет, на каких API тот говорит, и показывает результат: на каком API говорит сервер (OpenAI, Anthropic или оба), с какими CLI агентов он работает и сколько на нём моделей. Модели эмбеддингов скрыты.
Провайдера можно сохранить только после успешной проверки. Изменили поле — проверьте снова.
API выбирать не нужно — это делает проверка. Сервер, на котором ещё не загружена ни одна модель, всё равно можно сохранить: загрузите модель, а потом нажмите Обновить список моделей.
Ключ, если вы его указали, шифруется средствами операционной системы и передаётся только агентам, работающим на этом провайдере, — никогда не в командную строку и не в файлы. Провайдер без ключа никогда не переключается на ваш собственный вход в Claude или OpenAI: NeuroSquad передаёт CLI ключ-заглушку.
В списке каждый провайдер помечен как локальный (этот компьютер или ваша домашняя/офисная сеть) или удалённый, с адресом, API, числом моделей и отметкой, сохранён ли ключ.
2. Переведите на него агента
При создании агента (New agent… в меню добавления) или позже в меню ⋯ карточки → Provider and model выберите свой сервер в группе Ваши провайдеры и Модель из его списка. Изменение вступает в силу при следующем запуске агента. Чип на карточке показывает провайдера и модель.
Какие CLI агентов могут им пользоваться
| CLI агента | Что нужно на сервере |
|---|---|
| Claude Code | Anthropic API (/v1/messages) |
| Codex CLI | OpenAI API — через переводчик NeuroSquad, если у сервера нет Responses API (ниже) |
| Qwen Code | OpenAI API |
| Gemini CLI | OpenAI API, через небольшой переводчик, который NeuroSquad запускает на вашем компьютере |
| OpenCode, Kilo Code, Hermes Agent, Kimi Code, Pi, omp, Crush, Factory Droid, Cline CLI, aider, GitHub Copilot CLI, Goose | Любой из двух API |
| Cursor CLI, Amp, Auggie | Не могут — их модели работают только на серверах их разработчиков |
Многие локальные серверы говорят на обоих API на одном порту, так что ими может пользоваться любой CLI из таблицы. Если удалить провайдера, его агенты работают на собственном входе своего CLI, пока вы не выберете другого; карточка об этом сообщает.
Codex CLI на серверах без Responses API
Codex CLI говорит только на Responses API от OpenAI, а большинство локальных серверов — LM Studio, llama.cpp, vLLM, Ollama — и многие удалённые дают только Chat Completions. С таким сервером NeuroSquad запускает на вашем компьютере небольшой переводчик между Codex и сервером, и Codex работает и там. Настраивать ничего не нужно: у провайдера Codex CLI просто появляется в списке «Работает с».
- Ключ вашего сервера остаётся внутри NeuroSquad; Codex получает только пропуск к переводчику, свой для каждой карточки.
- Счётчики токенов — собственные числа сервера, передаются без изменений.
- Встроенный веб-поиск Codex так недоступен, а изображения в результатах инструментов доходят до модели заглушкой.
Сервер, у которого Responses API есть, используется напрямую.
Окно контекста
CLI агентов не знают, сколько контекста у модели на вашем сервере: Claude Code считает, что 200K токенов, а OpenCode без этого числа вообще не сжимает разговор. Длинная сессия тогда перерастает окно сервера и заканчивается ошибкой.
Если список моделей сервера сообщает, с каким окном контекста он отдаёт модель (n_ctx у llama.cpp,
max_model_len у vLLM или поле context_length, как у LM Studio и других), NeuroSquad передаёт его
дальше:
- Claude Code — окно и ограничение ответа: 32K токенов или четверть окна, что меньше.
- Codex CLI — окно и автоматическое сжатие на 85% от него.
- OpenCode — окно и то же ограничение ответа, чтобы он вовремя сжимал разговор.
Если сервер окно не сообщает, запускайте его с тем размером контекста, в котором должны работать агенты, или держите сессии короче и пользуйтесь Compact.
Стоимость
У моделей на вашем сервере нет прайсовой цены. Их токены учитываются в разделе Расход и стоимость, если CLI агента их записывает, а стоимость показывается как без цены — никогда не $0. Если локальный сервер не присылает счётчики кеша, они показаны как не сообщается, а не 0.
Небольшие локальные модели могут не справляться с инструментами некоторых CLI — особенно Claude Code, который сделан под модели Anthropic. Если агент застревает или неправильно вызывает инструменты, попробуйте модель побольше или CLI, рассчитанный на открытые модели, например OpenCode или Qwen Code.