可控的人-物交互合成
计算机视觉与模式识别
2024-07-16 v2
摘要
合成语义感知的、长时程的人-物交互对于模拟真实人类行为至关重要。在本工作中,我们解决了在3D场景中生成由语言描述引导的同步物体运动和人体运动这一具有挑战性的问题。我们提出了可控的人-物交互合成(CHOIS),这是一种在给定语言描述、初始物体与人体状态以及稀疏物体路径点的情况下,使用条件扩散模型同时生成物体运动和人体运动的方法。其中,语言描述提供风格和意图信息,而可以有效从高层规划中提取的路径点则将运动锚定于场景中。直接应用扩散模型无法预测与输入路径点对齐的物体运动,也无法确保需要精确手-物接触和人体-地面接触的交互的真实性。为克服这些问题,我们引入了物体几何损失作为额外监督,以改善生成的物体运动与输入物体路径点之间的匹配;我们还设计了引导项,在训练好的扩散模型的采样过程中强制施加接触约束。我们证明,我们学习到的交互模块能够合成真实的人-物交互,并遵循提供的文本描述和稀疏路径点条件。此外,我们的模块可与路径规划模块无缝集成,从而能够在3D环境中生成长期交互。
引用
@article{arxiv.2312.03913,
title = {Controllable Human-Object Interaction Synthesis},
author = {Jiaman Li and Alexander Clegg and Roozbeh Mottaghi and Jiajun Wu and Xavier Puig and C. Karen Liu},
journal= {arXiv preprint arXiv:2312.03913},
year = {2024}
}
备注
ECCV 2024, project webpage: https://lijiaman.github.io/projects/chois/