NVIDIA 提出一种前后端架构,让全双工语音模型通过发出委托 token,将流式转录转发给文本后端 LLM 执行工具调用,再经轻量 prefill-and-repeat 机制回传结果并由 TTS 播报。