HIMO:面向全身人类与多物体交互的新基准
计算机视觉与模式识别
2024-09-12 v2 人工智能
摘要
生成人物-物体交互(HOI)是数字化化身领域的关键任务。现有数据集通常仅限于人类与单个物体交互,忽略了多物体操作的普遍性。因此,我们提出HIMO,一个包含3.3K 4D HOI序列和408万3D HOI帧的大型MoCap数据集,涵盖人类与多个物体的全身交互。我们还为HIMO提供详细的文本描述和时间段,构建两个新任务:基于整个文本提示或分段文本提示(作为细粒度时间线控制)的HOI合成。为解决这些新任务,我们提出一种具有相互作用模块的双分支条件扩散模型,用于HOI合成。此外,还设计了自回归生成管道,以获得HOI片段之间的平滑过渡。实验结果表明,该方法能够对未见的物体几何形态和时间组成具有良好的泛化能力。
引用
@article{arxiv.2407.12371,
title = {HIMO: A New Benchmark for Full-Body Human Interacting with Multiple Objects},
author = {Xintao Lv and Liang Xu and Yichao Yan and Xin Jin and Congsheng Xu and Shuwen Wu and Yifan Liu and Lincheng Li and Mengxiao Bi and Wenjun Zeng and Xiaokang Yang},
journal= {arXiv preprint arXiv:2407.12371},
year = {2024}
}
备注
Project page: https://lvxintao.github.io/himo, accepted by ECCV 2024