中文

负样本帧在以自我为中心的视觉查询二维定位中至关重要

计算机视觉与模式识别 2022-08-04 v1

摘要

最近发布的 Ego4D 数据集与基准显著扩大并丰富了第一人称视觉感知数据。在 Ego4D 中,视觉查询二维定位(VQ2D)任务旨在从第一人称视角的录制视频中检索过去出现过的物体。该任务要求系统在给定的物体查询(由不同场景中物体的单个紧密视觉裁剪框注册)最晚出现的位置进行空间与时间上的定位。我们的研究基于情景记忆基准中引入的三阶段基线。该基线通过检测与跟踪解决问题:在所有帧中检测相似物体,然后从最可信的检测结果运行跟踪器。在 VQ2D 挑战中,我们发现了当前基线的两个局限。(1)训练配置存在冗余计算。尽管训练集有数百万实例,但其中大多数重复,唯一物体数量仅约 14.6k。对同一物体的重复梯度计算导致训练低效;(2)在背景帧上假阳性率高。这源于训练与评估间的分布差距。训练时模型只能看到干净、稳定且已标注的帧,但以自我为中心的视频也包含有噪声、模糊或未标注的背景帧。为此,我们开发了更高效且有效的方案。具体而言,我们将训练循环从约 15 天缩短至不到 24 小时,并取得了 0.17% 的时空 AP,比基线高 31%。我们的方案在公开排行榜上获得第一名次。我们的代码公开于 https://github.com/facebookresearch/vq2d_cvpr。

关键词

引用

@article{arxiv.2208.01949,
  title  = {Negative Frames Matter in Egocentric Visual Query 2D Localization},
  author = {Mengmeng Xu and Cheng-Yang Fu and Yanghao Li and Bernard Ghanem and Juan-Manuel Perez-Rua and Tao Xiang},
  journal= {arXiv preprint arXiv:2208.01949},
  year   = {2022}
}

备注

First place winning solution for VQ2D task in CVPR-2022 Ego4D Challenge. Our code is publicly available at https://github.com/facebookresearch/vq2d_cvpr