本地录音转文字怎么做:Buzz 离线语音转录与翻译完整指南

本地录音转文字怎么做:Buzz 离线语音转录与翻译完整指南 本地录音转文字怎么做Buzz 离线语音转录与翻译完整指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz手边有一段一小时的会议录音你想把它变成可搜索的文字再加一份 SRT 字幕又或者你在追一档外语播客希望边听边出翻译。大多数在线转录服务要求把音频上传到第三方服务器而公司资料、私人谈话并不适合这样处理。Buzz 就是为这个场景做的它跑在你自己的电脑macOS、Windows、Linux 均可上基于 OpenAI 的 Whisper 模型完成语音转录与翻译全程离线音频不离开你的机器。它既是一个图形界面应用也带命令行入口适合三类人需要处理录音/视频文件的个人与团队、要做实时字幕和同声传译的直播场景、以及希望把转录写进自动化流程的开发者。能力全景Buzz 到底能替你干什么把 Buzz 的能力摊开看大致是五条主线文件与链接转录导入本地音频/视频文件或粘贴一个视频链接转成文字或字幕实时录音转录直接对着麦克风录边说边出文字还有一个可投屏的演示窗口适合会议和演讲现场翻译Whisper 原生支持把语音翻译成英文文本另外可以接入任何 OpenAI 兼容的 AI 接口云端或本地 Ollama 等翻译成任意目标语言实时录音同样支持后处理转录结果里区分说话人、转写前的语音分离嘈杂环境下提升准确率、字幕自动重排多后端与扩展支持 Whisper 原版、Whisper.cpp带 Vulkan GPU 加速集显也能跑、Faster WhisperNvidia GPU、Hugging Face 上的各种 Whisper 兼容模型以及 OpenAI API 远程转录插件系统可以叠加 AI 摘要、自动字幕重排等能力。产物方面文字稿可以导出为 TXT、SRT、VTT 三种格式模型首次使用时自动下载并缓存在本机。最短可运行路径从安装到第一段文字选一条安装路径三条路按省事程度排序任选其一pip 安装跨平台需要 Python 3.12 与 ffmpegpip install buzz-captions python -m buzzLinux 系统包flatpak install flathub io.github.chidiwilliams.Buzz # 或者 sudo snap install buzz从源码构建想跑最新开发版时git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz pip install -e . python -m buzz在 Linux 上用 pip 方式如果启动报缺库先装系统依赖sudo apt-get install --no-install-recommends libyaml-dev libtbb-dev libxkbcommon-x11-0 \ libxcb-icccm4 libxcb-image0 libxcb-keysyms1 libxcb-randr0 libxcb-render-util0 \ libxcb-xinerama0 libxcb-shape0 libxcb-cursor0 libportaudio2 gettext libpulse0 ffmpeg执行python -m buzz后弹出主窗口说明安装成功。主界面就两块左上方是录音转录面板实时麦克风转写用下方的表格是所有转录任务的队列——每个文件一行带状态和进度。转录你的第一个文件第一次跑通跟着走这四步菜单 File → Import Media File或点工具栏快捷键 Ctrl/Cmd O选一个音频或视频文件在表单里选任务Transcribe 或 Translate、指定语言别用自动检测指定语言准确率更稳、选模型新手从whisper.cpp后端的tiny或base开始点 Run等状态列变成 Completed双击这一行打开转录查看器看结果。第一次运行会自动下载所选模型耐心等进度走完。模型文件会被缓存到本机Linux 在~/.cache/BuzzmacOS 在~/Library/Caches/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache之后再用就不用重复下载。按场景拆解四种最常见用法场景一转录单个文件顺便修错别字最基础的需求就是一段音频变文字。除了导入、选模型、运行还有三个进阶开关值得知道都在任务表单的 Advanced 里Initial prompt初始提示词把音频里高频出现的专有名词写进去人名、产品名、术语能明显减少同音误写Extract speech嘈杂音源先把人声抽出来再转录准确率更高Word-Level Timings按词生成字幕行之后可用内置的重排功能合并成正常字幕。导出格式在表单里直接选 TXT / SRT / VTT。另外导入时也可以直接粘贴一个视频 URLBuzz 会用 yt-dlp 在本地下载后转录不经过任何第三方服务器。场景二批量文件和命令行自动化文件多了以后一个点一个不现实。两种方式CLI 批量buzz add可以一次吃多个文件--hide-gui参数让任务在后台跑、不弹主窗口适合写进脚本。下面这条命令把两个法语 MP3 翻译成英文走 OpenAI API 后端buzz add --task translate --language fr --model-type openaiapi \ 会议A.mp3 会议B.mp3用本地模型加字幕导出则写成buzz add --model-type whispercpp --model-size small --srt --vtt 讲座.mp4跑完后对应文件旁会生成 .srt / .vtt可直接投给播放器或剪辑软件。所有参数随时用buzz add -h查完整说明见 docs/docs/cli.md。文件夹监听在偏好设置里配置 watch folder 后往该目录丢新文件就自动开始转录适合录音笔每晚同步一个目录这类固定流程。顺带一提如果你的机器算力不够把--model-type换成openaiapi转录就交给远程服务器Buzz 只负责取回结果。场景三对着麦克风实时转写点击 Record 就开始录音转写了。三个要点别用默认后端默认 Whisper 模型很吃资源实时场景建议选 Whisper.cpp 后端 小模型tiny/base它有 Vulkan 加速核显甚至纯 CPU 也能接近实时静默阈值偏好设置里的 Silence threshold 可以过滤掉你停顿时的环境噪音避免录进杂音演示窗口录音进行中可以打开 Presentation window一个只放大字幕的独立窗口投到会议室大屏上就是现场字幕组转录模式可设为追加倒序追加或追加并纠错纠错模式更吃算力。需要转的是电脑里正在播放的声音网课、视频音轨而不是麦克风装一个虚拟音频设备把系统声音路由成麦克风macOS 用 BlackHoleWindows 用 VB CABLELinux 用 PulseAudio 的pavucontrol重定向然后在 Buzz 的麦克风下拉框里选它。详细步骤在 docs/docs/usage/2_live_recording.md。场景四翻译成指定语言Whisper 自带的翻译能力只能翻成英文。要翻成中文、西语等其他语言需要配一个 OpenAI 兼容接口在 Preferences 里填 API Key 和 Base URL——既可以是云端服务也可以指向你自己机器上跑的 Ollama / LM Studio 等本地模型保持离线。给 AI 的翻译指令要写清楚例如You are a professional translator, skilled in translating English to Chinese. You will only translate each sentence sent to you into Chinese and not add any notes or comments.实时录音同样支持边录边翻。如果开启偏好里的实时转录导出文字和译文会随生成同步写入 .txt / .translated.txt 文件OBS Studio 可以直接拿这个文件做字幕源。结果核对与导出转录完成不等于结束字幕时间轴歪了、个别句子听错都需要人工过一遍。双击任务行打开的转录查看器就是干这个的可以搜索文字、按片段循环播放、调播放速度、逐段核对时间戳改错直接在编辑器里改。字幕太密或太稀时用内置的 resize 工具整体压缩/拉伸时间轴。核对完导出 TXT纯文字稿、SRT 或 VTT字幕即可。模型怎么选官方 FAQ 给了一个实用口径small 以下求快medium/large 求准large-v2 稳large-v3 更准但偶尔脑补词turbo 是速度与准度的折中。唯一可靠的方法是拿你自己的语言各测一遍。量化版本如q_5能让大模型在显存紧张时跑得动。踩坑与调优遇到这些问题怎么办转录太慢按下面顺序尝试通常前两步就够了换更小的模型tiny → base → small或改用 Whisper.cpp 后端有 Nvidia GPU 且显存 ≥ 6GB 的话切到 Faster Whisper 后端没有独显就用 Whisper.cpp任何 GPU 都能加速显存不够时开BUZZ_REDUCE_GPU_MEMORYtrue8bit 量化压显存实在慢改用openaiapi后端把计算扔给远程。启动或转录时崩溃最常见原因是模型下载不完整。到 Help → Preferences → Models 删掉对应模型重新下载。还不行就去 Help → About Buzz → Show logs 看日志附日志去报 issue。另外注意Buzz 要求 CPU 支持 AVX2太老的机器跑不起来。录音报错Unanticipated host error [PaErrorCode-9999]这是拿不到麦克风权限。Windows 到设置 → 隐私 → 麦克风里确认 Buzz 被允许访问并留意安全软件是否拦截。离线环境部署先在一台联网机器上把要用的模型下载好再到 Help → Preferences → Models 点Show file location找到缓存目录整个文件夹拷到离线机器的相同位置即可。仓库里还提供了 scripts/download-models.py 脚本可以批量准备离线模型缓存。常用调优环境变量高级选项通过环境变量设置Mac/Linux 写进启动脚本Windows 写进 .bat变量作用BUZZ_WHISPERCPP_N_THREADS8Whisper.cpp 线程数16 线程机器设 8 左右常有 ~15% 提速不是越大越快BUZZ_FORCE_CPUtrueGPU 反而更慢或出问题时强制走 CPUBUZZ_MODEL_ROOT/path指定模型缓存根目录建议与HF_HOME同目录HF_ENDPOINThttps://hf-mirror.com国内加速模型下载BUZZ_DISABLE_UPDATE_CHECKtrue关闭更新检查GPU 加速方面Linux Nvidia 开箱即用有问题装 CUDA 12/cuBLAS/cuDNNWindows 安装包已内置 CUDA 12老版本 CUDA 的机器会自动退回 CPU。延伸阅读使用文档文件导入、实时录音、翻译、编辑与字幕、说话人识别、查看器、插件docs/docs/usage/常见问题模型位置、模型选择、GPU、离线部署、崩溃排查docs/docs/faq.md偏好设置与全部环境变量docs/docs/preferences.md命令行完整参数docs/docs/cli.md或直接跑buzz add -h插件机制说明AI 摘要、语音分离、字幕重排等buzz/plugins/中文说明readme/README.zh_CN.md测试音频与模型样例做对比实验的素材testdata/接下来该做的三件事跑通最小闭环找一段 1 分钟左右的音频用 whisper.cpp 的 tiny 模型转录一次打开查看器核对并分别导出 TXT 和 SRT用播放器验证字幕时间轴。固定你的最佳后端 模型组合用同一段音频分别试 tiny、small、medium对比速度和准确率再按需设置BUZZ_WHISPERCPP_N_THREADS确认 GPU 是否真的在加速跑一次看时间和占用。把结果接入你的工作流做直播就配置实时录音 翻译导出接上 OBS做批量就用 watch folder 或buzz add --hide-gui脚本化。哪条路都走通后再考虑说话人分离、插件这些进阶能力。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考