Skip to Content
模型提供商你自己的服务器

你自己的服务器

除了 OpenRouter,你还可以添加你自己的提供方:你电脑上或局域网内的模型服务器——LM Studio、Ollama、Unsloth Studio、llama.cpp、vLLM——或任何兼容 OpenAI 或 Anthropic 格式的远程 API。智能体随后会使用该服务器模型列表中的模型。

1. 添加服务器

设置 → 提供方 → 你的提供方 → 添加提供方

选择你运行的服务器:LM Studio、Ollama、Unsloth Studio、llama.cpp 和 vLLM 会自动填入它们常用的地址和端口。其他情况选择其他或远程。

检查地址

名称、协议(http 或 https)、主机(localhost、IP 地址或 api.example.com——不带 http://,也不带端口)、端口。只有当服务器在子路径(例如 /api)下提供 API 时才填写路径。只有服务器要求时才填写 API 密钥。

测试连接

NeuroSquad 会读取服务器的模型列表,自行判断它支持哪些 API,然后显示结果:支持的 API(OpenAI、Anthropic 或两者)、可以使用它的智能体命令行工具,以及模型数量。嵌入模型会被隐藏。

保存

只有测试成功后才能保存提供方。修改任何字段后需要重新测试。

API 不需要你来选——测试会自动判断。还没有加载任何模型的服务器也可以保存:加载模型后,点击刷新模型列表即可。

如果填写了密钥,它会由操作系统加密,只交给运行在这个提供方上的智能体——绝不会写进它们的命令行或文件。没有密钥的提供方也绝不会退回到你自己的 Claude 或 OpenAI 登录:NeuroSquad 会给命令行工具一个占位密钥。

列表中每个提供方会标为本地(这台电脑或你的家庭/办公网络)或远程,并显示地址、API、模型数量以及是否已保存密钥。

2. 让智能体使用它

创建智能体时(添加菜单中的 New agent…),或之后在卡片的 ⋯ 菜单 → Provider and model 中,在你的提供方分组下选择你的服务器,再从其列表中选择模型。更改会在智能体下次启动时生效。卡片上的标签会显示提供方和模型。

哪些智能体命令行工具可以使用

智能体命令行工具服务器需要提供
Claude CodeAnthropic API(/v1/messages)
Codex CLIOpenAI API——服务器没有 Responses API 时通过 NeuroSquad 的转换器(见下文)
Qwen CodeOpenAI API
Gemini CLIOpenAI API,通过 NeuroSquad 在你电脑上运行的小型转换器
OpenCode、Kilo Code、Hermes Agent、Kimi Code、Pi、omp、Crush、Factory Droid、Cline CLI、aider、GitHub Copilot CLI、Goose两种 API 皆可
Cursor CLI、Amp、Auggie不支持——它们的模型只在各自厂商的服务器上运行

很多本地服务器在同一个端口上同时提供两种 API,因此表中的每个命令行工具都能使用它们。删除提供方后,使用它的智能体会改用其命令行工具自己的登录,直到你选择另一个提供方;卡片会提示这一点。

在没有 Responses API 的服务器上使用 Codex CLI

Codex CLI 只支持 OpenAI 的 Responses API,而大多数本地服务器(LM Studio、llama.cpp、vLLM、Ollama)和很多远程服务只提供 Chat Completions。遇到这样的服务器,NeuroSquad 会在你的电脑上于 Codex 和服务器之间运行一个小型转换器,让 Codex 也能在那里工作。无需任何设置:该提供方的“适用于”列表中会直接出现 Codex CLI。

  • 你服务器的密钥留在 NeuroSquad 内部;Codex 只拿到一个按卡片分配的转换器通行凭证。
  • 词元数量是服务器自己报告的数字,原样传递。
  • 这种方式下无法使用 Codex 内置的网页搜索,工具结果中的图片会以占位符的形式传给模型。

本身提供 Responses API 的服务器会被直接使用。

上下文窗口

智能体命令行工具并不知道你服务器上的模型有多大的上下文:Claude Code 默认按 200K 词元计算,而 OpenCode 没有这个数字就从不压缩对话。长会话因此会超出服务器的窗口,最终以错误结束。

当服务器的模型列表注明了它为模型提供的上下文窗口(llama.cpp 的 n_ctx、vLLM 的 max_model_len,或 LM Studio 等提供的 context_length 字段)时,NeuroSquad 会把它传下去:

  • Claude Code——窗口大小,并把输出上限设为 32K 词元或窗口的四分之一,取较小者。
  • Codex CLI——窗口大小,并在用到 85% 时自动压缩。
  • OpenCode——窗口大小和同样的输出上限,让它及时压缩。

如果你的服务器不报告窗口大小,请用你希望智能体使用的上下文大小启动服务器,或者让会话短一些并使用 Compact。

费用

你自己服务器上的模型没有标价。只要智能体命令行工具记录了词元,它们就会计入用量与费用,费用显示为无价格——绝不会显示为 $0。不发送缓存计数的本地服务器,其缓存数会显示为未报告,而不是 0。

较小的本地模型未必能稳定驱动所有智能体命令行工具的工具调用——尤其是专为 Anthropic 模型打造的 Claude Code。如果智能体卡住或错误地使用工具,可以换一个更大的模型,或者改用为开放模型设计的命令行工具,例如 OpenCode 或 Qwen Code。