moshi
更新于 2026-09-03 16:44:32
moshi:实时全双工语音对话系统
moshi 利用先进的流式神经音频编码器 Mimi,实现了一个能够进行实时、同时听和说(全双工)、自然对话的语音系统。它不仅能听懂你说的话,还可以像正常对话一样回答你的问题,整个过程几乎没有延迟,并允许在对话中随时插话。目前仅支持用英语交流,可以用来练习英语口语,有助于克服开口说英语的障碍。
核心能力
- 全双工对话:边听边说,可随时插话。
- 低延迟:近实时自然交流。
- Mimi 编解码:流式神经音频支撑。
- 口语陪练:英语场景练开口。
适用场景
- 练习英语口语、克服不敢开口。
- 体验低延迟语音 AI。
- 研究与二次开发对话系统。
上手与二开建议
- 按文档起服务,用麦克风英语对话。
- 体验插话与打断。
- 二开:围绕模型与编解码扩展。
注意事项
- 上手难度高:依赖模型与算力。
- 目前仅英语,注意语言限制。