WhisperLiveKit
更新于 2026-09-03 16:10:50
WhisperLiveKit:开箱即用的本地语音转写工具
WhisperLiveKit 是一款集实时语音转文本、翻译和说话人分离于一体的开源工具,自带服务器端和 Web UI,一条命令即可私有化部署。它基于最新的增量流式技术,无需联网、也无需写前端代码,就能实现超低延迟的会议实时记录与跨语言交流,适合对隐私与延迟都有要求的场景。
核心能力
- 实时转写:增量流式识别,低延迟输出字幕/文本。
- 翻译:转写同时可做跨语言翻译(如英译中)。
- 说话人分离:区分不同发言者,便于会议记录归属。
- 私有化:本地运行、不联网,数据不出本机。
- 开箱即用:内置服务端 + Web UI,免前端开发。
示例
# 使用 large-v3 模型,并将英语翻译为中文
whisperlivekit-server --model large-v3 --language en --target-language zh
# 说话人分离,服务器监听 80 端口
whisperlivekit-server --host 0.0.0.0 --port 80 --model medium --diarization --language zh
适用场景
- 会议实时字幕与记录,尤其多语言沟通。
- 对语音数据隐私敏感、需本地部署的团队。
- 访谈、课堂等需要说话人区分的转写。
上手与二开建议
- 一条命令起服务端,浏览器打开 Web UI 即可使用。
- 按机器算力选模型(large-v3 精度高、medium 更轻)。
- 二开:围绕模型、翻译目标与 diarization 扩展;协议将由系统从 GitHub 自动同步。
注意事项
- 上手难度中等:依赖本地模型与算力,大模型对显存/内存要求较高。
- 翻译与分离效果受模型与音频质量影响,重要纪录请人工核对。