工具2026-06-28

本地语音识别免费方案:Whisper 全平台对比(2026 版)

约 8 分钟阅读 · 找到最适合你的免费本地方案

过去两年 OpenAI 开源的 Whisper 把"本地语音识别免费"这件事从"做得到"变成了"做得好"。问题不再是"有没有免费方案",而是"这么多方案我该选哪个"。

本文把目前主流的免费本地语音识别方案做一次系统对比,并告诉你哪种人适合哪种工具。

先说结论:本地语音识别的三大主流路线

  • 原生编译路线:Whisper.cpp / faster-whisper,C++ 实现,性能最好。
  • 桌面 GUI 路线:MacWhisper、buzz、WhisperDesktop,给原生引擎套壳,普通人友好。
  • 浏览器路线:transformers.js + WebGPU/WASM,免安装、跨平台。

方案对比表

方案平台门槛速度适合
Whisper.cpp(命令行)全平台极快开发者
faster-whisper(Python)全平台极快Python 用户
MacWhispermacOS极低快(Apple Silicon)Mac 普通用户
buzz全平台跨平台普通用户
WhisperDesktopWindows快(GPU)Windows 用户
transformers.js(浏览器)全平台极低不愿装软件的人
Talk2Text(浏览器)全平台极低要 UI、要导出的人

各方案详细点评

Whisper.cpp

C/C++ 高性能实现,支持 CPU、CUDA、Metal、Vulkan。命令行操作,速度通常是 Python 版的 2-4 倍。适合有命令行基础、追求性能的开发者。

缺点:纯命令行,普通人不会用。

faster-whisper

基于 CTranslate2 的 Python 实现,相比官方 transformers 版快 4 倍、内存占用减半。是 Python 生态事实标准。缺点:要装 Python、CTranslate2、模型权重。

MacWhisper

macOS 上最受欢迎的客户端,基于 whisper.cpp。Apple Silicon 上速度极佳。免费版有限制,高级功能要付费。缺点:仅 Mac、部分功能收费。

buzz

开源跨平台 GUI,基于 whisper.cpp。界面简单,支持实时转录和文件转录。缺点:界面偏简陋,导出格式有限。

WhisperDesktop

Windows 上常被推荐的客户端,支持 NVIDIA GPU 加速。缺点:仅 Windows。

transformers.js(浏览器)

Hugging Face 出品的 JS 库,让 Whisper 直接在浏览器里跑。借助 WebGPU 加速,速度接近原生。优点:免安装、跨平台、代码可审计。缺点:依赖浏览器性能。

Talk2Text

基于 transformers.js 的浏览器端工具,给纯算法套了一个产品化的 UI:上传 → 进度 → 编辑 → 导出 SRT/VTT/TXT。定位:不想装软件又想要好用 UI 的普通人。

按需求推荐

你是开发者,追求极致性能

Whisper.cppfaster-whisper,能榨干硬件性能。

你是 Mac 用户

MacWhisper,体验最丝滑。如果不想付费又想跨设备用,配 Talk2Text 兜底。

你是 Windows 用户

有 NVIDIA 显卡 → WhisperDesktop;没有 → buzzTalk2Text

你完全不想装软件

Talk2Text。浏览器打开就用,关掉就清空,跨设备一致。

你想要 SRT / VTT 字幕格式

Talk2Text、MacWhisper、buzz 都原生支持。命令行版需要自己处理时间戳。

你想要实时转录(边说边出字)

buzz 支持,MacWhisper 支持。Talk2Text 当前定位是文件转录,实时转录在路线图上。

不想装软件,又想要好用的转写工具?

Talk2Text 浏览器打开就能用,免费、免装、免注册,导出 SRT / VTT / TXT。

免费试用

本地语音识别的硬件性能参考

Whisper 在不同硬件上的实际表现(以 1 小时清晰中文录音为例,使用 small 模型):

  • Apple M2 / M3:约 3-5 分钟转完
  • Intel i7 + RTX 3060:约 4-6 分钟
  • Intel i7 集显:约 10-15 分钟
  • 中端手机(浏览器):约 20-30 分钟

如果嫌慢,换 tiny / base 模型可以快 2-3 倍,精度略降但日常够用。

常见疑问 FAQ

真的完全免费吗?

Whisper.cpp、faster-whisper、buzz、transformers.js 都是开源免费的。MacWhisper、WhisperDesktop 基础功能免费,高级功能收费。Talk2Text 完全免费。

本地处理需要联网吗?

仅在第一次下载模型时联网,之后完全离线可用。Talk2Text 会把模型缓存到浏览器,第二次起可以断网用。

对硬件要求高吗?

2020 年之后的主流设备基本都能跑。tiny 模型 2GB 内存就够;large 模型建议 8GB+ 显存或 16GB+ 统一内存。

和云端付费方案比,准确率差距多大?

small 模型在普通话清晰录音上已经接近云端水准;large 模型在多数场景下不输甚至超过云端 API。差距主要体现在强噪声、重口音、多人重叠。

手机能用吗?

iOS Safari、Android Chrome 较新版本可以跑 Talk2Text,但速度比电脑慢。重要文件建议用电脑处理。

结论

2026 年,免费本地语音识别已经不是有没有的问题,而是怎么选的问题。原则很简单:追求性能选原生,追求体验选桌面 GUI,追求免装和跨设备选浏览器。如果你不想折腾环境,又想要可用的 UI,Talk2Text 是最直接的答案。