中文

ViBES:具行为智能的 3D 对话式智能体

计算机视觉与模式识别 2026-04-16 v2

摘要

人类沟通本质上是多模态和社会性的:语言、韵律和肢体语言共同承载意图。然而,大多数先前系统将人类行为建模为翻译任务——协作手势或文本到运动,将固定语句映射到运动片段,而无需智能体对何时移动、做什么或如何在多轮对话中适应作出决策。这导致 timing 脆弱、社交 grounding 弱、以及 speech、text 和 motion 在孤立环境中训练或推断的碎片化堆栈。我们提出 ViBES(Voice in Behavioral Expression and Synchrony,即语音在行为表达与同步中的作用),一个能够联合规划语言与运动、并执行对话条件化身体动作的 3D 对话式智能体。具体而言,ViBES 是一个 speech-language-behavior(SLB)模型,采用 mixture-of-modality-experts(MoME)主干架构:针对语音、面部表情和身体运动的模态分区变换专家。该模型以硬路由方式处理交错的多模态 token 流(参数按专家划分),通过 cross-expert attention 共享信息。凭借强大的预训练 speech-language 模型,该智能体支持混合意图交互:用户可在对话中发言、输入或发出身体动作指令,系统还暴露可控的行为挂钩,用于流式响应。我们进一步在多轮对话上进行基准测试,使用 dialogue-motion alignment 和 behavior quality 的自动指标,观察到相较于强大的 co-speech 和 text-to-motion 基线模型,ViBES 持续获得性能提升。ViBES 的实践超越了“speech-conditioned motion generation”(语音条件化运动生成),朝着语言、韵律和运动联合生成的智能体式虚拟身体迈进,实现可控、社交能力强的 3D 交互。代码与数据将在 ai.stanford.edu/~juze/ViBES/ 公开。

关键词

引用

@article{arxiv.2512.14234,
  title  = {ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body},
  author = {Juze Zhang and Changan Chen and Xin Chen and Heng Yu and Tiange Xiang and Ali Sartaz Khan and Shrinidhi K. Lakshmikanth and Ehsan Adeli},
  journal= {arXiv preprint arXiv:2512.14234},
  year   = {2026}
}

备注

Project page: https://ai.stanford.edu/~juze/ViBES/. Accepted by CVPR 2026