基于过程式交互生成的无模板人-物交互重建
计算机视觉与模式识别
2024-04-09 v3
摘要
从单张 RGB 图像中进行 3D 人-物交互重建是一项具有挑战性的任务,现有的数据驱动方法无法泛化到精心整理的 3D 交互数据集中未出现的物体。由于人-物交互的组合性质,捕获大规模真实数据以学习强交互和 3D 形状先验非常昂贵。在本文中,我们提出了 ProciGen(过程式交互生成,Procedural interaction Generation),一种以过程式生成兼具合理交互与多样物体变化的数据集的方法。我们在 3D 中生成了超过 100 万对人-物交互数据,并利用这一大规模数据来训练我们的 HDM(分层扩散模型,Hierarchical Diffusion Model),这是一种无需任何模板即可重建交互人类与未见物体的新方法。我们的 HDM 是一个图像条件扩散模型,能够学习真实的交互以及高精度的人体和物体形状。实验表明,我们使用 ProciGen 训练的 HDM 显著优于需要模板网格的现有方法,并且我们的数据集能够训练出对未见物体实例具有强泛化能力的方法。我们的代码和数据已开源。
引用
@article{arxiv.2312.07063,
title = {Template Free Reconstruction of Human-object Interaction with Procedural Interaction Generation},
author = {Xianghui Xie and Bharat Lal Bhatnagar and Jan Eric Lenssen and Gerard Pons-Moll},
journal= {arXiv preprint arXiv:2312.07063},
year = {2024}
}
备注
CVPR'24 camera ready version. 25 pages, 20 figures. Project page: https://virtualhumans.mpi-inf.mpg.de/procigen-hdm