中文

通过多模态空间校正器的自我中心场景理解

计算机视觉与模式识别 2022-07-15 v1 人工智能

摘要

本文研究自我中心场景理解问题,即从自我中心图像预测深度与表面法线。自我中心场景理解带来了前所未有的挑战:(1)由于大幅头部运动,图像从非规范视角(即倾斜图像)拍摄,现有几何预测模型不适用;(2)包括手在内的动态前景物体占据了视觉场景的很大比例。这些挑战限制了从大型室内数据集(如 ScanNet 和 NYUv2,其主要由静态场景的正立图像组成)学习到的现有模型的性能。我们提出一种多模态空间校正器,将自我中心图像稳定到一组参考方向,从而允许学习一致的视觉表示。与常产生过度透视扭曲的单模态空间校正器不同,多模态空间校正器从多个方向学习,可最小化透视扭曲的影响。为学习动态前景物体的视觉表示,我们提出了一个称为 EDINA(Egocentric Depth on everyday INdoor Activities)的新数据集,包含超过 50 万同步 RGBD 帧与重力方向。借助多模态空间校正器与 EDINA 数据集,我们提出的单视图深度与表面法线估计方法不仅在 EDINA 数据集上,也在其他流行的自我中心数据集(如 First Person Hand Action (FPHA) 和 EPIC-KITCHENS)上显著优于基线。

关键词

引用

@article{arxiv.2207.07077,
  title  = {Egocentric Scene Understanding via Multimodal Spatial Rectifier},
  author = {Tien Do and Khiem Vuong and Hyun Soo Park},
  journal= {arXiv preprint arXiv:2207.07077},
  year   = {2022}
}

备注

Appearing in the Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022