欢迎来到威聚
威扬盘搜

WhisperLiveKit

AI 工具 Python 未知(创建后将从 GitHub 自动同步) AI 总结 推荐 ★4 中等

更新于 2026-09-03 16:10:50

WhisperLiveKit:开箱即用的本地语音转写工具

WhisperLiveKit 是一款集实时语音转文本、翻译和说话人分离于一体的开源工具,自带服务器端和 Web UI,一条命令即可私有化部署。它基于最新的增量流式技术,无需联网、也无需写前端代码,就能实现超低延迟的会议实时记录与跨语言交流,适合对隐私与延迟都有要求的场景。

核心能力

  • 实时转写:增量流式识别,低延迟输出字幕/文本。
  • 翻译:转写同时可做跨语言翻译(如英译中)。
  • 说话人分离:区分不同发言者,便于会议记录归属。
  • 私有化:本地运行、不联网,数据不出本机。
  • 开箱即用:内置服务端 + Web UI,免前端开发。

示例

# 使用 large-v3 模型,并将英语翻译为中文
whisperlivekit-server --model large-v3 --language en --target-language zh

# 说话人分离,服务器监听 80 端口
whisperlivekit-server --host 0.0.0.0 --port 80 --model medium --diarization --language zh

适用场景

  • 会议实时字幕与记录,尤其多语言沟通。
  • 对语音数据隐私敏感、需本地部署的团队。
  • 访谈、课堂等需要说话人区分的转写。

上手与二开建议

  1. 一条命令起服务端,浏览器打开 Web UI 即可使用。
  2. 按机器算力选模型(large-v3 精度高、medium 更轻)。
  3. 二开:围绕模型、翻译目标与 diarization 扩展;协议将由系统从 GitHub 自动同步。

注意事项

  • 上手难度中等:依赖本地模型与算力,大模型对显存/内存要求较高。
  • 翻译与分离效果受模型与音频质量影响,重要纪录请人工核对。

按更新时间依次阅读