H+O:第一视角下 3D 手-物姿态与交互的统一识别
计算机视觉与模式识别
2019-04-11 v1
摘要
我们提出了一个统一框架,用于理解来自第一视角 RGB 相机的原始图像序列中的 3D 手与物体交互。给定单张 RGB 图像,我们的模型通过神经网络单次前向传播联合估计 3D 手与物体姿态、建模其交互,并识别物体与动作类别。我们提出了一种不依赖外部检测算法、而是在单图像上端到端训练的单一架构。我们进一步在时域中融合与传播信息,以推断手与物体轨迹间的交互并识别动作。完整模型以帧序列为输入,输出逐帧的 3D 手与物体姿态预测,以及整个序列的物体与动作类别估计。我们展示了算法的最先进性能,即使与基于深度数据和真值标注的方法相比亦然。
引用
@article{arxiv.1904.05349,
title = {H+O: Unified Egocentric Recognition of 3D Hand-Object Poses and Interactions},
author = {Bugra Tekin and Federica Bogo and Marc Pollefeys},
journal= {arXiv preprint arXiv:1904.05349},
year = {2019}
}
备注
CVPR 2019 (Oral)