详情
英伟达在实时 AI 语音交互领域再出新成果,对外发布 NemotronLabs VoiceChat11B,这也是该企业首款开源端到端全双工语音对话大模型,代表巨头在语音感知与语音生成底层技术层面取得关键性进展。
传统语音交互方案普遍采用拼接式架构,依次调用语音识别 ASR、大语言模型 LLM、语音合成 TTS 三类模块完成对话流程。而 VoiceChat11B 跳出这套分步处理逻辑,依托单一神经网络,一站式实现流式语音的理解与输出。这套方案省去多模块之间复杂的调度对接流程,有效压低交互时延。实测结果表明,模型平滑切换时延仅 448 毫秒,原生支持边听边说的全双工模式;面对用户中途打断插话的场景,模型可以快速停止输出,对话体验更加自然连贯。
该开源模型还有一项亮眼特性:它是业内为数不多可在对话过程中同步完成工具调用的全双工开源方案。模型设置专属输出通路,搭配内置缓冲话术机制,当系统对接外部 API 处理复杂任务时,可经由独立通道输出预设过渡语句,规避运算等待阶段出现的长时间静音问题,大幅降低语音智能体落地开发的工程难度。
当然该产品现阶段还属于试验版本,落地仍有现实门槛。想要流畅跑通该模型,单卡显卡显存至少要达到 80GB,同时官方明确该模型仅用于科研探索,暂未上线商用托管接口。行业分析认为,虽然长文本上下文、超长多轮对话等极限场景中,模型还存在短板,但对外开放的模型权重与容器化部署方案,已经为呼叫中心、车载座舱、线下零售点餐、无障碍智能设备等场景的研发人员,开辟出新的技术实现思路。
