基于Transformer模型的从配对互动数据学习反应式人体运动生成
计算机视觉与模式识别
2026-04-27 v1
摘要
深度学习的最新进展已使从文本描述生成视频以及从输入视频预测未来序列成为可能。类似地,在人体运动建模中,可以从文本生成运动,或从单个人的运动序列进行预测。然而,这些方法主要关注单主体运动生成。相反,本研究解决了一个问题:在互动场景中,根据他人的运动生成一个人的运动,其中两种运动相互依赖。我们从拳击赛视频中提取配对的动作-反应运动序列,构建了一个数据集,并研究了Transformer模型在该任务中的有效性。具体而言,我们实现并比较了三个模型:简单Transformer、iTransformer和Crossformer。此外,我们引入了人员ID嵌入,显式区分个体,使模型能够保持结构一致性并更好地捕捉互动动态。实验结果表明,简单Transformer可以在不出现姿态坍缩的情况下生成合理的互动感知运动,而iTransformer和Crossformer会随时间累积误差,导致运动生成不稳定。此外,提出的人员ID嵌入有助于防止结构坍缩并提高运动一致性。这些结果突显了在互动感知运动生成中显式建模个体身份的重要性。
引用
@article{arxiv.2604.22164,
title = {Learning Reactive Human Motion Generation from Paired Interaction Data Using Transformer-Based Models},
author = {Masato Soga and Ryuki Takebayashi},
journal= {arXiv preprint arXiv:2604.22164},
year = {2026}
}
备注
24 pages