# 语音输入

> 对 nsq 智能体说话而不是打字——语音在你的电脑上识别，文字只粘贴、不发送。

Source: https://docs.neurosquad.ai/zh/cli/dictation

在仪表盘中按 `v`（或使用全局快捷键 `Ctrl Shift Space`，Mac 上是 `Cmd Shift Space`），说话，然后停止。文字会粘贴到当前全屏打开的智能体中；如果没有，则粘贴到所选的智能体中。

- **绝不会替你按 Enter。** 先看一遍识别结果，需要时修改，然后自己发送。
- **音频不会离开你的电脑。** 语音在本地识别；音频只在内存中保存当前这一句，绝不写入磁盘。

## 设置

语音识别模型只需下载一次——首次使用时自动下载，也可以提前下载：

```sh
nsq dictation setup     # 下载模型（按 SHA-256 校验）
nsq dictation status    # 模型、文件夹、快捷键
```

| 模型 | 大小 | 语言 |
| --- | --- | --- |
| `parakeet-tdt-0.6b-v3`（默认）——NVIDIA Parakeet TDT 0.6B v3，CC-BY-4.0 | 约 670 MB | 25 种欧洲语言 |
| `whisper-large-v3-turbo`——OpenAI Whisper large-v3-turbo，MIT | 约 1 GB | 约 100 种，自动识别 |

中文请选择 Whisper：使用 `--model whisper-large-v3-turbo`，或在配置中设置（见下文）。`nsq dictation test <file.wav>` 会用模型处理一段录音，用来检查是否正常工作。

## 快捷键

默认情况下，轻按一次开始录音，再按一次停止；按住不放则一直录到松开为止。快捷键是全局的——即使终端不在前台也有效——而且不会吞掉按键，所以请选一个终端没有占用的组合。

```json
{
  "dictation": {
    "hotkey": "F9",
    "mode": "hold",
    "model": "whisper-large-v3-turbo"
  }
}
```

写在 `~/.neurosquad-cli/config.json` 中。`"mode"`：`"hold"` 表示按住时录音，`"toggle"` 表示每按一次开始或停止。`"enabled": false` 关闭语音输入。

## 平台说明

- **macOS：** 你的终端应用需要**麦克风**权限；全局快捷键还需要**辅助功能 / 输入监控**权限（系统设置 → 隐私与安全性）。
- **Linux：** 全局快捷键需要 X11；在 Wayland 下请使用仪表盘中的 `v`。在 Linux arm64 上会使用 `PATH` 中的录音程序（`arecord`、`parecord`、`pw-record`、`sox` 或 `ffmpeg`）。
- **通过 SSH** 时，远程一侧没有麦克风，也没有全局快捷键。

> 语音输入是 nsq 的可选组件，Windows arm64 上不可用。如果它没能安装，nsq 的其他功能照常可用，`nsq dictation status` 会告诉你原因。
