Mac 全局语音输入:用 Whisper 在任意应用中离线听写
在邮件、文档、聊天和代码编辑器中使用本地语音输入:快捷键设置、麦克风选择、标点习惯、隐私边界与故障排查。
更新于

先看结论
- 全局听写与长音频转录不同,首字延迟和快捷键可靠性比峰值吞吐更重要。
- 使用按住说话的触发方式,可降低误录和权限范围不清的问题。
- 代码、姓名和术语仍需要键盘修正,语音适合初稿而不是盲目替代全部输入。
全局语音输入和普通转录有什么不同
普通转录处理已经完成的音频,允许等待更长时间换取完整上下文;全局听写发生在写邮件、聊天或编辑文档的当下,更重视启动速度、停止准确和文字插入位置。两者使用相似的语音识别技术,却有不同的产品指标。
理想流程是按住 Fn 或自定义快捷键开始,说完松开,文字插入当前光标。明确的按住说话比持续监听更容易理解,也减少无意录入。用户应能看到录音状态,并随时撤销麦克风与辅助功能权限。
第一次设置:权限、快捷键和麦克风
全局听写通常需要麦克风权限来采集声音,并需要辅助功能权限把文字写入当前应用。分别解释两项权限的用途,只从“系统设置 → 隐私与安全性”授权。不要为了排障关闭 Gatekeeper 或授予与功能无关的权限。
选择不与系统功能冲突的快捷键,再测试内置麦克风、耳机和外接麦克风。安静环境下,Mac 内置麦克风通常足够;共享办公室中,靠近嘴部的耳麦能减少他人说话和键盘声。
怎样说,文字更接近可用初稿
一次说一个完整思想,句子之间短暂停顿。先说结论,再补充原因和下一步。对姓名、产品名和代码标识符,预期需要键盘修正;不要为了让模型识别而把自然表达变得过于僵硬。
在邮件中可以口述“背景—请求—截止时间”;在任务工具中口述“动作—对象—日期”;在代码编辑器中更适合写注释、提交说明和文档,而不是逐字符编程。选择语音真正减少摩擦的部分。
本地听写的隐私边界
模型在 Mac 本地运行,可以避免把语音发送到云端转录服务,也能在断网时工作。但识别结果会被插入当前应用;如果目标应用本身会云同步,文本仍可能离开设备。隐私判断必须覆盖输入目标,而不只是识别引擎。
会议、医疗、法律或他人对话仍受录音同意与组织政策约束。全局听写最适合记录自己的话。使用后可在系统权限列表中复查访问,并清理不需要的临时录音。
没有反应、插入错误或速度慢时怎样排查
先在简单的文本编辑器中测试。如果能识别但不能插入,检查辅助功能权限和目标应用限制;完全没有波形,检查麦克风权限与输入设备;快捷键无效,检查是否与系统或其他应用冲突。
速度突然下降时,查看模型是否刚更新或重新加载、设备是否处于低电量模式、是否有其他大型任务占用统一内存。把问题缩小到录音、识别或文字插入三个阶段,比重复重装更有效。
常见问题
Mac 全局语音输入必须联网吗?
如果应用使用已下载到设备的本地模型,识别过程可以离线完成。应用更新、模型下载或目标应用同步可能仍需网络。
为什么需要辅助功能权限?
该权限用于把识别文字插入当前应用的光标位置。它能力较大,应只授予可信应用,并在不用时可随时撤销。
语音输入适合写代码吗?
更适合注释、文档、提交信息和自然语言提示。符号密集的代码通常仍以键盘和编辑器补全更高效。