Buzz 离线音频转录完整指南:三步在本地跑起来语音转文字

Buzz 离线音频转录完整指南:三步在本地跑起来语音转文字 Buzz 离线音频转录完整指南三步在本地跑起来语音转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz开会录音不想上传给云端在线转录服务按分钟收费还担心隐私Buzz 就是一个本地离线音频转录工具音频全程留在你的电脑上由 OpenAI 的 Whisper 模型在本地完成语音转文字免费、开源、可完全断网使用。项目快照Buzz 是什么Buzz 是一款桌面应用底层跑的是 Whisper 语音识别技术OpenAI 开源的语音转文字模型支持 99 种以上语言的转录还能把非英语音频直接翻译成英文文本。除了导入本地文件它也支持直接录麦克风实时转录、导入 YouTube 链接甚至可以通过命令行脚本化批处理。项目速览说明输入格式MP3、WAV、MP4、M4A 等主流音频/视频文件或麦克风实时录音语言支持99 种语言Whisper可接 MMS 等模型扩展至 1000 种是否联网转录完全本地进行可断网使用模型首次需联网下载是否收费免费MIT 开源协议环境搭建分平台最短安装路径平台安装方式Windows / macOS从项目发布页下载安装包.exe / .dmg双击安装即可Windows 首次安装若提示未签名选仍要运行Linuxsudo snap install buzz或flatpak install flathub io.github.chidiwilliams.BuzzPython 环境pip install buzz-captions然后python -m buzz启动需 Python 3.12 并安装 ffmpeg两点提示首次运行会自动下载所选 Whisper 模型到本地缓存目录Linux 在~/.cache/BuzzmacOS 在~/Library/Caches/Buzz建议先在有网环境跑一次。完全离线的机器可先在有网电脑下载模型把模型文件夹整体拷过去即可官方还附带了离线模型准备脚本 scripts/download-models.py。能力全景Buzz 能做什么核心能力一句话说明批量文件转录一次导入多个文件自动排队、显示进度完成即导出多后端模型Whisper / Faster Whisper / Whisper.cpp / HuggingFace 四种后端覆盖 NVIDIA GPU、Apple Silicon、核显 Vulkan、纯 CPU实时录音转录麦克风边录边转支持追加并纠正模式可开演讲窗口投屏转录查看器带搜索、播放控制、语速调节、时间戳微调的编辑器字幕与文本处理字幕重排Resize、说话人识别、导出 TXT / SRT / VTT / DOCX自动与脚本化文件夹监控自动转录新文件、命令行 CLI、插件系统场景实战一会议记录实时录音转成文字目标开一场 1 小时会议结束后手里有一份带时间戳的文字记录。在 Buzz 主界面选择任务Transcribe、明确选定语言如中文比自动检测更稳、选麦克风。后端选Whisper.cpp、模型选 Tiny 或 Base——实时转录对算力敏感小模型 Whisper.cpp 是低延迟组合核显甚至纯 CPU 也能跑。点 Record 开始录制文字随语音实时出现在界面上需要投屏展示可打开 Presentation Window演讲窗口。会议结束停止录音双击任务行打开转录结果导出为 TXT 或 SRT。产出一份带时间戳的完整会议转录文本全程没有离开你的电脑。场景实战二视频批量做字幕导出 SRT 进剪辑软件目标把一周积累的 5 个 MP4 视频批量转成可直接套用的 SRT 字幕。文件菜单Import Media File或 Ctrl/Cmd O一次性勾选所有视频文件加入任务队列。每个任务把Export As设为 SRT并勾选Word-Level Timings逐字时间戳——这是后面能用字幕重排工具自由合并长短的关键。按硬件选模型有 NVIDIA 显卡选 Faster Whisper Medium 追求平衡追求精度选 Large 系列。点 Run 后 Buzz 自动逐个排队处理。完成后双击打开转录查看器用播放和语速控制核对每一句点Resize按钮设置单条字幕最大长度40~50 字符较合适、是否按标点断句重新合并后导出。产出5 个时长合规、可直接导入剪辑软件的 SRT 文件。场景实战三访谈录音分说话人整理资料目标一段多人访谈整理出谁在什么时间说了什么的稿子。导入访谈音频点 Advanced 按钮填Initial prompt初始提示词把人名、专业术语写进去能显著减少专有名词的错字。转录完成后打开查看器点Identify speakers说话人识别Buzz 自动把每句话打上说话人标签。每个标签可试听 10 秒随机片段来确认身份把自动标签改成真实姓名勾选合并同一说话人语句再保存。导出成 TXT/DOCXDOCX 由插件提供进入资料归档流程。产出带说话人姓名、可合并段落的访谈整理稿。调优与排错选对模型和后端场景 / 硬件建议效果笔记本、无独显实时转录Whisper.cpp 后端 Tiny/Base 小模型延迟低核显/纯 CPU 可用NVIDIA 显卡6GB 显存以上Faster Whisper Medium速度与精度平衡比原始 Whisper 快多个量级追求最高精度论文、出版级Large-V3 或 Turbo精度最佳Large-V3 偶发幻觉写出音频里没有的词重要内容建议抽检完全断网环境拷贝模型目录或用 scripts/download-models.py 预置模型缓存离线机器开箱即转高频问答Q转录太慢A换更小的模型或改用 Whisper.cpp有独显就开 GPU 加速Windows 安装包自带 CUDALinux 开箱即用。Q准确率不理想A换大一号模型明确选定语言而不是自动检测用 Initial prompt 把高频专有名词喂给模型。Q录不进声音报 PaErrorCode-9999A检查系统给 Buzz 的麦克风权限Windows 在设置 → 隐私 → 麦克风临时关闭杀毒软件测试。进阶与资源Buzz 自带插件系统plugins/内置 AI 摘要、字幕自动重排、DOCX 导出、降噪DeepFilterNet、语言检测增强等也支持自己写插件扩展常用入口内置插件源码plugins/ai_summary/、plugins/transcript_resizer/、plugins/export_docx/使用文档文件导入 / 实时录音 / 说话人识别等docs/docs/usage/命令行用法脚本化批量转录docs/docs/cli.md常见问题模型存放位置、GPU 加速、离线使用docs/docs/faq.md写在最后Buzz 把语音转文字这件过去依赖云端的事完整地搬回了你自己的电脑文件不上行、费用为零、断网可跑从会议速记到视频字幕都能覆盖。装好后从最小的 Tiny 模型试一条文件再按精度需求逐步升级十分钟就能进入工作流。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考