面向人-物交互的精细二维-三维联合表示
计算机视觉与模式识别
2020-05-22 v2 机器学习
摘要
人-物交互(Human-Object Interaction, HOI)检测处于动作理解的核心。除了人/物体外观与位置等二维信息外,三维姿态因其视角无关性也常用于HOI学习。然而,粗糙的三维身体关节仅携带稀疏的身体信息,不足以理解复杂交互。因此,我们需要精细的三维身体形状以进一步深入。同时,三维空间中交互的物体在HOI学习中也未得到充分研究。有鉴于此,我们提出一种精细的二维-三维联合表示学习方法。首先,我们利用单视角人体捕捉方法获取精细的三维身体、面部与手部形状。接着,参考二维人-物空间配置与物体类别先验,估计三维物体位置与尺寸。最后,提出联合学习框架与跨模态一致性任务以学习联合HOI表示。为更好地评估模型处理二维歧义的能力,我们提出一个名为Ambiguous-HOI的新基准,其由困难的歧义图像组成。在大规模HOI基准与Ambiguous-HOI上的大量实验表明了我们方法的显著有效性。代码与数据见https://github.com/DirtyHarryLYL/DJ-RN。
引用
@article{arxiv.2004.08154,
title = {Detailed 2D-3D Joint Representation for Human-Object Interaction},
author = {Yong-Lu Li and Xinpeng Liu and Han Lu and Shiyi Wang and Junqi Liu and Jiefeng Li and Cewu Lu},
journal= {arXiv preprint arXiv:2004.08154},
year = {2020}
}
备注
Accepted to CVPR 2020, supplementary materials included, code available:https://github.com/DirtyHarryLYL/DJ-RN