中文

基于Rectified Flow的统一多模态交互式与自适应3D运动生成

计算机视觉与模式识别 2026-03-10 v3

摘要

生成符合情境感知的、以多模态为条件的两人运动,仍是图形学、动画和具身AI系统的根本挑战。虚拟现实/增强现实伴侣、社交机器人和游戏智能体等实际应用需要能够产生协调人际行为的模型,同时灵活地在交互式与自适应生成之间切换。我们引入DualFlow,首个统一且高效的两人运动多模态生成框架。DualFlow以多样化输入(包括文本、音乐和先前运动序列)为条件生成3D运动。利用Rectified Flow,它实现了从噪声到数据的确定性直线采样路径,减少推理时间,缓解扩散模型中常见的误差积累。为增强语义对齐,DualFlow采用新颖的检索增强生成(RAG)模块,用于两人运动,通过音乐特征和基于LLM的文本分解检索运动范例,涉及空间关系、身体运动和节奏模式。我们采用对比度Rectified Flow目标进一步锐化与条件信号的对齐,并添加同步损失以提高人物间的时序协调。广泛的评估覆盖交互式、自适应和多模态基准,表明DualFlow在运动质量、响应性和语义忠实度方面 consistently 提供了改进。DualFlow在两人多模态运动生成中实现了最先进的性能,产生连贯、富有表现力且节奏感同步的运动。

关键词

引用

@article{arxiv.2509.24099,
  title  = {Unified Multi-Modal Interactive & Reactive 3D Motion Generation via Rectified Flow},
  author = {Prerit Gupta and Shourya Verma and Ananth Grama and Aniket Bera},
  journal= {arXiv preprint arXiv:2509.24099},
  year   = {2026}
}

备注

Under review at ICLR 2026