中文

端到端 Listen, Look, Speak and Act

人工智能 2026-04-21 v2 计算与语言 计算机视觉与模式识别 机器人学 音频与语音处理

摘要

人类交互本质上是多模态和全双工的:我们在观察的同时倾听,在行动的同时说话,并且流畅地适应轮次交换和中断。实现这些能力对于构建模拟人类行为的模型至关重要。我们提出了 ELLSA(End-to-end Listen, Look, Speak and Act),据我们了解,这是首个在单一架构中同时跨视觉、文本、语音和动作进行感知与生成的全双工、端到端模型,使以往无法实现的交互模式成为可能,产生更自然、类似人类的行为。在其核心是一种新颖的 SA-MoE 架构(Self-Attention Mixture-of-Experts),该架构将每个模态路由到专门的专家,并通过统一的注意力主干进行融合。这为联合多模态感知和并发生成提供了通用解决方案,同时利用强大的预训练组件,实现高效的模态集成并缓解模态干扰。在语音交互和机器人操控基准测试上,ELLSA 与各模态特定的基线相当,而独特支持诸如对话和动作轮次交换、损坏指令拒绝、说话时行动、语境 grounding 视觉问答和动作抢占等高级多模态和全双工行为。我们认为,ELLSA 是通往更自然、更通用交互智能的一步,为更广泛的人工通用智能的实现做出了贡献。所有数据、代码和模型检查点将在 https://github.com/bytedance/SALMONN/tree/ELLSA 上发布。

关键词

引用

@article{arxiv.2510.16756,
  title  = {End-to-end Listen, Look, Speak and Act},
  author = {Siyin Wang and Wenyi Yu and Xianzhao Chen and Xiaohai Tian and Jun Zhang and Lu Lu and Chao Zhang},
  journal= {arXiv preprint arXiv:2510.16756},
  year   = {2026}
}

备注

22 pages, 8 figures