ChipChat:基于 MLX 的低延迟级联对话智能体
音频与语音处理
2025-09-03 v1 计算与语言
机器学习
声音
摘要
大型语言模型 (LLM) 的兴起已变革了语音对话系统,但面向实时设备语音智能体的最优架构仍是开放问题。虽然端到端方法在理论上具有优势,但级联系统 (CS) 仍在语言理解任务中超越它们,尽管受制于顺序处理延迟。本文引入 ChipChat,一种新型低延迟 CS,通过架构创新和流式优化克服了传统瓶颈。我们的系统集成了 (1) 带混合专家的流式对话语音识别、(2) 带状态-动作增强的 LLM、(3) 文本转语音合成、(4) 神经声码器、和 (5) 说话人建模。基于 MLX 实现的 ChipChat 在 Mac Studio 上无需专用 GPU 即可实现亚秒响应延迟,同时通过完全设备内处理保持用户隐私。我们的工作表明,战略性地重新设计的 CS 已克服了历史性的延迟限制,为实用语音 AI 智能体提供了可行之路。
引用
@article{arxiv.2509.00078,
title = {ChipChat: Low-Latency Cascaded Conversational Agent in MLX},
author = {Tatiana Likhomanenko and Luke Carlson and Richard He Bai and Zijin Gu and Han Tran and Zakaria Aldeneh and Yizhe Zhang and Ruixiang Zhang and Huangjie Zheng and Navdeep Jaitly},
journal= {arXiv preprint arXiv:2509.00078},
year = {2025}
}
备注
ASRU 2025