# 你自己的服务器

> 让智能体运行在你自己服务器上的模型上——LM Studio、Ollama、Unsloth Studio、llama.cpp、vLLM——或任何兼容 OpenAI 或 Anthropic 格式的远程 API。

Source: https://docs.neurosquad.ai/zh/providers/your-servers

除了 [OpenRouter](https://docs.neurosquad.ai/zh/providers/openrouter)，你还可以添加**你自己的提供方**：你电脑上或局域网内的模型服务器——LM Studio、Ollama、Unsloth Studio、llama.cpp、vLLM——或任何兼容 OpenAI 或 Anthropic 格式的远程 API。智能体随后会使用该服务器模型列表中的模型。

## 1. 添加服务器

**1. 设置 → 提供方 → 你的提供方 → 添加提供方**

选择你运行的**服务器**：LM Studio、Ollama、Unsloth Studio、llama.cpp 和 vLLM 会自动填入它们常用的地址和端口。其他情况选择**其他或远程**。

**2. 检查地址**

**名称**、**协议**（http 或 https）、**主机**（`localhost`、IP 地址或 `api.example.com`——不带 `http://`，也不带端口）、**端口**。只有当服务器在子路径（例如 `/api`）下提供 API 时才填写**路径**。只有服务器要求时才填写 **API 密钥**。

**3. 测试连接**

NeuroSquad 会读取服务器的模型列表，自行判断它支持哪些 API，然后显示结果：支持的 API（OpenAI、Anthropic 或两者）、可以使用它的智能体命令行工具，以及模型数量。嵌入模型会被隐藏。

**4. 保存**

只有测试成功后才能保存提供方。修改任何字段后需要重新测试。

API 不需要你来选——测试会自动判断。还没有加载任何模型的服务器也可以保存：加载模型后，点击**刷新模型列表**即可。

如果填写了密钥，它会由操作系统加密，只交给运行在这个提供方上的智能体——绝不会写进它们的命令行或文件。没有密钥的提供方也绝不会退回到你自己的 Claude 或 OpenAI 登录：NeuroSquad 会给命令行工具一个占位密钥。

列表中每个提供方会标为**本地**（这台电脑或你的家庭/办公网络）或**远程**，并显示地址、API、模型数量以及是否已保存密钥。

## 2. 让智能体使用它

创建智能体时（添加菜单中的 **New agent…**），或之后在卡片的 ⋯ 菜单 → **Provider and model** 中，在**你的提供方**分组下选择你的服务器，再从其列表中选择**模型**。更改会在智能体下次启动时生效。卡片上的标签会显示提供方和模型。

## 哪些智能体命令行工具可以使用

| 智能体命令行工具 | 服务器需要提供 |
| --- | --- |
| Claude Code | Anthropic API（`/v1/messages`） |
| Codex CLI | OpenAI API——服务器没有 Responses API 时通过 NeuroSquad 的转换器（[见下文](#codex)） |
| Qwen Code | OpenAI API |
| Gemini CLI | OpenAI API，通过 NeuroSquad 在你电脑上运行的小型转换器 |
| OpenCode、Kilo Code、Hermes Agent、Kimi Code、Pi、omp、Crush、Factory Droid、Cline CLI、aider、GitHub Copilot CLI、Goose | 两种 API 皆可 |
| Cursor CLI、Amp、Auggie | 不支持——它们的模型只在各自厂商的服务器上运行 |

很多本地服务器在同一个端口上同时提供两种 API，因此表中的每个命令行工具都能使用它们。删除提供方后，使用它的智能体会改用其命令行工具自己的登录，直到你选择另一个提供方；卡片会提示这一点。

## 在没有 Responses API 的服务器上使用 Codex CLI

Codex CLI 只支持 OpenAI 的 Responses API，而大多数本地服务器（LM Studio、llama.cpp、vLLM、Ollama）和很多远程服务只提供 Chat Completions。遇到这样的服务器，NeuroSquad 会在你的电脑上于 Codex 和服务器之间运行一个小型转换器，让 Codex 也能在那里工作。无需任何设置：该提供方的“适用于”列表中会直接出现 Codex CLI。

- 你服务器的密钥留在 NeuroSquad 内部；Codex 只拿到一个按卡片分配的转换器通行凭证。
- 词元数量是服务器自己报告的数字，原样传递。
- 这种方式下无法使用 Codex 内置的网页搜索，工具结果中的图片会以占位符的形式传给模型。

本身提供 Responses API 的服务器会被直接使用。

## 上下文窗口

智能体命令行工具并不知道你服务器上的模型有多大的上下文：Claude Code 默认按 200K 词元计算，而 OpenCode 没有这个数字就从不压缩对话。长会话因此会超出服务器的窗口，最终以错误结束。

当服务器的模型列表注明了它为模型提供的上下文窗口（llama.cpp 的 `n_ctx`、vLLM 的 `max_model_len`，或 LM Studio 等提供的 `context_length` 字段）时，NeuroSquad 会把它传下去：

- **Claude Code**——窗口大小，并把输出上限设为 32K 词元或窗口的四分之一，取较小者。
- **Codex CLI**——窗口大小，并在用到 85% 时自动压缩。
- **OpenCode**——窗口大小和同样的输出上限，让它及时压缩。

如果你的服务器不报告窗口大小，请用你希望智能体使用的上下文大小启动服务器，或者让会话短一些并使用 **Compact**。

## 费用

你自己服务器上的模型没有标价。只要智能体命令行工具记录了词元，它们就会计入[用量与费用](https://docs.neurosquad.ai/zh/usage)，费用显示为**无价格**——绝不会显示为 $0。不发送缓存计数的本地服务器，其缓存数会显示为**未报告**，而不是 0。

> 较小的本地模型未必能稳定驱动所有智能体命令行工具的工具调用——尤其是专为 Anthropic 模型打造的 Claude Code。如果智能体卡住或错误地使用工具，可以换一个更大的模型，或者改用为开放模型设计的命令行工具，例如 OpenCode 或 Qwen Code。
