中文

MoReact:从文本描述生成具有响应性的运动

计算机视觉与模式识别 2025-09-30 v1

摘要

建模和生成人类反应是计算机视觉和人机交互领域的重要挑战,具有广泛应用前景。现有方法要么将多个个体视为单一实体,直接生成相互作用,要么仅依赖单个人的动作来生成另一人的反应,未能整合支撑人类相互作用的丰富语义信息。然而,这些方法在自适应响应性方面常常不足,即无法准确响应多样且动态的相互作用情景。为弥合这一差距,我们的工作提出一种针对现有模型局限性的解决方案,专注于文本驱动的人类反应生成。我们的模型专为生成基于交互情景描述文本中指导下的个体动作序列而设计。目标是产生不仅与对手动作相符,又能在语义上符合所述交互的运动序列。为实现这一目标,我们提出 MoReact,一种基于扩散的方法,旨在依序解耦全局轨迹和局部运动的生成。这一方法源于这样一种观察:首先生成全局轨迹对于引导局部运动至关重要,确保与给定动作和文本更好地对齐。此外,我们引入一种新型相互作用损失,以增强生成紧密相互作用的真实感。我们的实验采用来自两个人运动数据集适配后的数据,展示了该方法为该新任务有效果,能够产生真实、多样且可控的反应,不仅紧密匹配对手的动作,还遵循文本指导。请访问我们的网页 https://xiyan-xu.github.io/MoReactWebPage。

关键词

引用

@article{arxiv.2509.23911,
  title  = {MoReact: Generating Reactive Motion from Textual Descriptions},
  author = {Xiyan Xu and Sirui Xu and Yu-Xiong Wang and Liang-Yan Gui},
  journal= {arXiv preprint arXiv:2509.23911},
  year   = {2025}
}

备注

Published in Transactions on Machine Learning Research