中文

我的钱包在哪?以自我中心视觉查询定位为目标建模物体提议集

计算机视觉与模式识别 2023-04-07 v2

摘要

本文研究从视觉样例在图像和视频数据集中定位物体的问题。我们特别关注具有挑战性的自我中心视觉查询定位问题。我们首先识别出当前查询条件模型设计与视觉查询数据集中严重的隐式偏差。然后,我们在帧与物体集两个层面直接应对这些偏差。具体而言,我们的方法通过扩充有限标注并在训练时动态丢弃物体提议来解决这些问题。此外,我们提出一种新颖的基于 transformer 的模块,可在融入查询信息的同时考虑物体提议集上下文。我们将该模块命名为条件上下文 Transformer(CocoFormer)。实验表明,所提改进提升了自我中心查询检测,从而在 2D 与 3D 配置下得到更好的视觉查询定位系统。因此,我们能将帧级检测性能从 AP 26.28% 提升至 31.26,相应大幅提升了 VQ2D 与 VQ3D 定位分数。我们改进的场景感知查询物体检测器在第二届 Ego4D 挑战赛的 VQ2D 与 VQ3D 任务中分获第一与第二。此外,我们展示了所提模型在少样本检测(FSD)任务中的相关性,并在该任务上也取得了 SOTA 结果。我们的代码见 https://github.com/facebookresearch/vq2d_cvpr。

关键词

引用

@article{arxiv.2211.10528,
  title  = {Where is my Wallet? Modeling Object Proposal Sets for Egocentric Visual Query Localization},
  author = {Mengmeng Xu and Yanghao Li and Cheng-Yang Fu and Bernard Ghanem and Tao Xiang and Juan-Manuel Perez-Rua},
  journal= {arXiv preprint arXiv:2211.10528},
  year   = {2023}
}

备注

We ranked first and second in the VQ2D and VQ3D tasks in the 2nd Ego4D challenge