本地语音识别免费方案:Whisper 全平台对比(2026 版)
过去两年 OpenAI 开源的 Whisper 把"本地语音识别免费"这件事从"做得到"变成了"做得好"。问题不再是"有没有免费方案",而是"这么多方案我该选哪个"。
本文把目前主流的免费本地语音识别方案做一次系统对比,并告诉你哪种人适合哪种工具。
先说结论:本地语音识别的三大主流路线
- 原生编译路线:Whisper.cpp / faster-whisper,C++ 实现,性能最好。
- 桌面 GUI 路线:MacWhisper、buzz、WhisperDesktop,给原生引擎套壳,普通人友好。
- 浏览器路线:transformers.js + WebGPU/WASM,免安装、跨平台。
方案对比表
| 方案 | 平台 | 门槛 | 速度 | 适合 |
|---|---|---|---|---|
| Whisper.cpp(命令行) | 全平台 | 高 | 极快 | 开发者 |
| faster-whisper(Python) | 全平台 | 高 | 极快 | Python 用户 |
| MacWhisper | macOS | 极低 | 快(Apple Silicon) | Mac 普通用户 |
| buzz | 全平台 | 低 | 中 | 跨平台普通用户 |
| WhisperDesktop | Windows | 低 | 快(GPU) | Windows 用户 |
| transformers.js(浏览器) | 全平台 | 极低 | 中 | 不愿装软件的人 |
| Talk2Text(浏览器) | 全平台 | 极低 | 中 | 要 UI、要导出的人 |
各方案详细点评
Whisper.cpp
C/C++ 高性能实现,支持 CPU、CUDA、Metal、Vulkan。命令行操作,速度通常是 Python 版的 2-4 倍。适合有命令行基础、追求性能的开发者。
缺点:纯命令行,普通人不会用。
faster-whisper
基于 CTranslate2 的 Python 实现,相比官方 transformers 版快 4 倍、内存占用减半。是 Python 生态事实标准。缺点:要装 Python、CTranslate2、模型权重。
MacWhisper
macOS 上最受欢迎的客户端,基于 whisper.cpp。Apple Silicon 上速度极佳。免费版有限制,高级功能要付费。缺点:仅 Mac、部分功能收费。
buzz
开源跨平台 GUI,基于 whisper.cpp。界面简单,支持实时转录和文件转录。缺点:界面偏简陋,导出格式有限。
WhisperDesktop
Windows 上常被推荐的客户端,支持 NVIDIA GPU 加速。缺点:仅 Windows。
transformers.js(浏览器)
Hugging Face 出品的 JS 库,让 Whisper 直接在浏览器里跑。借助 WebGPU 加速,速度接近原生。优点:免安装、跨平台、代码可审计。缺点:依赖浏览器性能。
Talk2Text
基于 transformers.js 的浏览器端工具,给纯算法套了一个产品化的 UI:上传 → 进度 → 编辑 → 导出 SRT/VTT/TXT。定位:不想装软件又想要好用 UI 的普通人。
按需求推荐
你是开发者,追求极致性能
选 Whisper.cpp 或 faster-whisper,能榨干硬件性能。
你是 Mac 用户
选 MacWhisper,体验最丝滑。如果不想付费又想跨设备用,配 Talk2Text 兜底。
你是 Windows 用户
有 NVIDIA 显卡 → WhisperDesktop;没有 → buzz 或 Talk2Text。
你完全不想装软件
选 Talk2Text。浏览器打开就用,关掉就清空,跨设备一致。
你想要 SRT / VTT 字幕格式
Talk2Text、MacWhisper、buzz 都原生支持。命令行版需要自己处理时间戳。
你想要实时转录(边说边出字)
buzz 支持,MacWhisper 支持。Talk2Text 当前定位是文件转录,实时转录在路线图上。
本地语音识别的硬件性能参考
Whisper 在不同硬件上的实际表现(以 1 小时清晰中文录音为例,使用 small 模型):
- Apple M2 / M3:约 3-5 分钟转完
- Intel i7 + RTX 3060:约 4-6 分钟
- Intel i7 集显:约 10-15 分钟
- 中端手机(浏览器):约 20-30 分钟
如果嫌慢,换 tiny / base 模型可以快 2-3 倍,精度略降但日常够用。
常见疑问 FAQ
真的完全免费吗?
Whisper.cpp、faster-whisper、buzz、transformers.js 都是开源免费的。MacWhisper、WhisperDesktop 基础功能免费,高级功能收费。Talk2Text 完全免费。
本地处理需要联网吗?
仅在第一次下载模型时联网,之后完全离线可用。Talk2Text 会把模型缓存到浏览器,第二次起可以断网用。
对硬件要求高吗?
2020 年之后的主流设备基本都能跑。tiny 模型 2GB 内存就够;large 模型建议 8GB+ 显存或 16GB+ 统一内存。
和云端付费方案比,准确率差距多大?
small 模型在普通话清晰录音上已经接近云端水准;large 模型在多数场景下不输甚至超过云端 API。差距主要体现在强噪声、重口音、多人重叠。
手机能用吗?
iOS Safari、Android Chrome 较新版本可以跑 Talk2Text,但速度比电脑慢。重要文件建议用电脑处理。
结论
2026 年,免费本地语音识别已经不是有没有的问题,而是怎么选的问题。原则很简单:追求性能选原生,追求体验选桌面 GUI,追求免装和跨设备选浏览器。如果你不想折腾环境,又想要可用的 UI,Talk2Text 是最直接的答案。