Faster-Whisper 快速指南:用 CTranslate2 重写 Whisper,把 13 分钟音频转录压进 1 分钟

Faster-Whisper 快速指南:用 CTranslate2 重写 Whisper,把 13 分钟音频转录压进 1 分钟 Faster-Whisper 快速指南用 CTranslate2 重写 Whisper把 13 分钟音频转录压进 1 分钟【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper先说一个扎心的场景你手里有一段 13 分钟的会议录音用原版 Whisper 转录光 GPU 上就要等 2 分 23 秒要是攒了一天的录音批量处理等待时间会按小时计。faster-whisper 就是为此而生的——它是基于 CTranslate2 推理引擎重写的 Whisper转录精度和原版持平速度最高快 4 倍显存占用还能砍掉一半多。换句话说同样的硬件你能干完原本两倍的活。原版 Whisper 慢在哪faster-whisper 的答案是换掉推理引擎Whisper 模型本身没问题问题出在跑模型的引擎上openai/whisper 用的是 PyTorch对纯推理任务来说开销偏大。faster-whisper 的做法是保留 Whisper 模型权重只把推理层换成专为 Transformer 推理优化的 CTranslate2并支持 FP16 和 INT8 两种精度。这意味着你不需要换模型、不需要改流水线替换一个 pip 包就能拿到数倍提速。实测提速多少看这组 13 分钟音频的数据以下是在 NVIDIA RTX 3070 Ti 上转录同一段 13 分钟音频、使用 large-v2 模型的对比方案精度耗时显存openai/whisperfp162 分 23 秒4708 MBfaster-whisperfp161 分 03 秒4525 MBfaster-whisperbatch_size8fp1617 秒6090 MBfaster-whisperint859 秒2926 MB一句话解读单条转录提速约 2 倍配合批量推理直接压到 17 秒而 int8 量化把显存从 4.7 GB 砍到 2.9 GB——同一张卡能同时跑更多任务。CPU 端同样受益i7-12700K 上跑 small 模型 int8 只需 1 分 42 秒、内存 1477 MB而原版要 6 分 58 秒、占用 2335 MB。数据看完了实际用起来更简单下面三步就能跑通。三步上手装包、建模型、拿结果第一步装依赖pip install faster-whisper这里有个小福利它通过 PyAV 内置了解码库不用像原版那样额外安装 FFmpeg少一个环境变量排查的坑。第二步初始化模型并转录核心入口在 WhisperModelfrom faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5)第三步遍历 segments 即可拿到带起止时间的文本片段。小提醒segments 是生成器只有你真正迭代它时转录才启动。跑通这一步你得到的不只是文字还有每段话的精确时间点——这是做字幕、做检索的基础。三个实用开关词级时间戳、VAD 过滤、批量转录基础转录跑通后有三个参数最值得开。一是词级时间戳加一个word_timestampsTrue每个字都能对上起止时间做卡拉OK式字幕或高亮定位直接可用二是 VAD 过滤vad_filterTrue会先让内置的 Silero VAD 把静音段剪掉再喂给模型长音频里大段空白不再浪费算力三是批量转录适合 GPU 用户from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(large-v3, devicecuda, compute_typefloat16) batched BatchedInferencePipeline(modelmodel) segments, info batched.transcribe(audio.mp3, batch_size16)这就是前面表格里 17 秒的来源。想细调静音判断的灵敏度还能通过vad_parameters传参默认行为定义在 vad.py 里。进阶如何开启 8 位量化以及加载自己微调的模型量化是省资源的利器把初始化时的compute_type改成int8CPU或int8_float16GPU权重体积和内存占用立刻下降精度损失通常在可接受范围内——前面表格里 int8 的 59 秒/2926 MB 就是这么来的。如果你的 GPU 是 CUDA 11 或 cuDNN 8 的旧环境可以把 ctranslate2 降级到 4.4.0 来兼容。另外它天然兼容 distil-whisper 蒸馏系列如 distil-large-v3以及用 Transformers 转换来的任意微调模型装好 transformers 后用 ct2-transformers-converter 把你的 Whisper 权重转成 CTranslate2 格式再WhisperModel(你的模型目录)加载即可。换句话说你花心思微调过的领域模型也能搭上这台快引擎。社区生态方面WhisperX 类项目用它做说话人分离、还有 OpenAI 兼容服务、实时流式转录等方向都有成熟方案接入成本很低。回到开头那个场景同样一段 13 分钟录音faster-whisper 把等待时间从 2 分 23 秒压到 17 秒量级且显存减半——对于要长期批量处理音频的团队这笔账值得立刻算。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考