中文

EgoLoc:基于视觉查询从自我中心视频重新审视3D物体定位

计算机视觉与模式识别 2023-08-29 v2

摘要

随着视频与3D理解的最新进展,融合二者概念的新颖4D时空方法已经出现。在此方向上,Ego4D情景记忆基准提出了带有3D定位的视觉查询(VQ3D)任务。给定一个自我中心视频片段和一张描绘查询物体的图像裁剪,目标是相对于查询帧的相机位姿定位该查询物体中心的3D位置。当前方法通过将从兄弟任务带有2D定位的视觉查询(VQ2D)的2D定位结果反投影为3D预测来解决VQ3D问题。然而,我们指出先前VQ3D方法因相机重定位导致的相机位姿数量少严重阻碍了它们的整体成功率。在本工作中,我们形式化了一条流程(称为EgoLoc),其更好地将3D多视角几何与从自我中心视频中的2D物体检索相纠缠。我们的方法涉及估计更鲁棒的相机位姿,并通过利用2D检测置信度聚合多视角3D位移,从而提升物体查询的成功率并显著改进VQ3D基线性能。具体而言,我们的方法实现了高达87.12%的整体成功率,在VQ3D任务中树立了最新的state-of-the-art结果。我们对VQ3D任务及现有解法提供了全面的实证分析,并强调了VQ3D中剩余的挑战。代码可在https://github.com/Wayne-Mai/EgoLoc获取。

关键词

引用

@article{arxiv.2212.06969,
  title  = {EgoLoc: Revisiting 3D Object Localization from Egocentric Videos with Visual Queries},
  author = {Jinjie Mai and Abdullah Hamdi and Silvio Giancola and Chen Zhao and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2212.06969},
  year   = {2023}
}

备注

ICCV 2023