Whisper 本地语音转文字:从零搭建开源 ASR 转写环境

导读 如果你有一段录音(会议、播客、课堂笔记),想快速把它变成文字稿——以前你可能要花钱买在线转写服务,或者花好几天搭一套复杂的深度学习系统。今天我们要用的 Whisper 正好解决了这个问题:它是 OpenAI 在 2022 年开源的多语言语音识别模型,可以在你自己的电脑上离线运行,免费、隐私有保障,支持中文在内的 99 种语言。 本篇从零开始,帮你把整个环境搭起来。只需要一个前置依赖 ffmpeg,剩下的通过 pip 一行命令搞定。文末提供一键脚本,Windows / macOS / Linux 都能跑。 一、Whisper 是什么? Whisper 是 OpenAI 发布的一个自动语音识别(ASR,Automatic Speech Recognition)模型。它用来自 68 万小时多语言+多标签数据的训练数据训练的,核心特点包括: 开源免费:Apache 2.0 许可,可以随意修改和商业使用 多语言:支持中文、英文、日语等 99 种语言的识别和翻译 本地运行:不需要联网调用 API,装好就在本机跑,保护隐私 开箱即用:命令行工具 + Python API 双接口,小白也能上手 GitHub 仓库地址:https://github.com/openai/whisper (国内用户访问不畅时,可以加 ghfast.top 前缀代理:https://ghfast.top/https://github.com/openai/whisper) 模型规格一览 Whisper 提供了多个规格(规格越大,准确率越高,但需要的内存和速度越慢)。官方共有以下模型供选择: 模型 参数量 VRAM 需求 参考速度 适用场景 tiny 39M ~1 GB 最快 快速原型验证 base 74M ~1 GB 快 日常轻度使用 small 244M ~2 GB 中等 较好中文效果 medium 769M ~5 GB 较慢 高准确率要求 large-v1/v2/v3 1.5B ~10 GB 很慢 最高精度 distil-small/en / distil-medium/en 量化蒸馏版 — 比原版快 2~6 倍 英文加速(非官方完整版) 推荐起步策略:先用 tiny 或 base 确认流程畅通,再按需换 small 或更大的模型。 ...

2026-08-26 · 10 min · AIGestalt