语音输入
在仪表盘中按 v(或使用全局快捷键 CtrlShiftSpace,Mac 上是 CmdShiftSpace),说话,然后停止。文字会粘贴到当前全屏打开的智能体中;如果没有,则粘贴到所选的智能体中。
- 绝不会替你按 Enter。 先看一遍识别结果,需要时修改,然后自己发送。
- 音频不会离开你的电脑。 语音在本地识别;音频只在内存中保存当前这一句,绝不写入磁盘。
设置
语音识别模型只需下载一次——首次使用时自动下载,也可以提前下载:
nsq dictation setup # 下载模型(按 SHA-256 校验)
nsq dictation status # 模型、文件夹、快捷键| 模型 | 大小 | 语言 |
|---|---|---|
parakeet-tdt-0.6b-v3(默认)——NVIDIA Parakeet TDT 0.6B v3,CC-BY-4.0 | 约 670 MB | 25 种欧洲语言 |
whisper-large-v3-turbo——OpenAI Whisper large-v3-turbo,MIT | 约 1 GB | 约 100 种,自动识别 |
中文请选择 Whisper:使用 --model whisper-large-v3-turbo,或在配置中设置(见下文)。nsq dictation test <file.wav> 会用模型处理一段录音,用来检查是否正常工作。
快捷键
默认情况下,轻按一次开始录音,再按一次停止;按住不放则一直录到松开为止。快捷键是全局的——即使终端不在前台也有效——而且不会吞掉按键,所以请选一个终端没有占用的组合。
{
"dictation": {
"hotkey": "F9",
"mode": "hold",
"model": "whisper-large-v3-turbo"
}
}写在 ~/.neurosquad-cli/config.json 中。"mode":"hold" 表示按住时录音,"toggle" 表示每按一次开始或停止。"enabled": false 关闭语音输入。
平台说明
- macOS: 你的终端应用需要麦克风权限;全局快捷键还需要辅助功能 / 输入监控权限(系统设置 → 隐私与安全性)。
- Linux: 全局快捷键需要 X11;在 Wayland 下请使用仪表盘中的 v。在 Linux arm64 上会使用
PATH中的录音程序(arecord、parecord、pw-record、sox或ffmpeg)。 - 通过 SSH 时,远程一侧没有麦克风,也没有全局快捷键。
语音输入是 nsq 的可选组件,Windows arm64 上不可用。如果它没能安装,nsq 的其他功能照常可用,nsq dictation status 会告诉你原因。