中文

Helping Hands:一种物体感知的自我中心视频识别模型

计算机视觉与模式识别 2023-08-16 v1

摘要

我们引入一种物体感知解码器,用于提升时空表征在自我中心视频上的性能。其核心思想是在训练过程中通过令模型预测手部位置、物体位置及物体语义标签(在可用时使用配对字幕)来增强物体感知。推理时模型仅需RGB帧作为输入,并能够跟踪与定位物体(尽管并未显式训练用于此)。我们通过以下方式展示本模型所学物体感知表征的性能:(i) 在多个下游视频-文本检索与分类基准上以强迁移即零样本测试进行评估;以及 (ii) 将所学表征作为长时视频理解任务(如Ego4D中的情景记忆)的输入。在所有情况下性能均优于当前最优——即便与以远大于本模型的批大小训练的网路相比亦然。我们还展示,通过在训练中使用含噪图像级检测作为伪标签,模型借助视频一致性学到了更好的边界框,并将关联文本描述中的词语接地。总体而言,我们表明该模型可作为自我中心视频模型的即插即用替代以通过视觉-文本接地提升性能。

关键词

引用

@article{arxiv.2308.07918,
  title  = {Helping Hands: An Object-Aware Ego-Centric Video Recognition Model},
  author = {Chuhan Zhang and Ankush Gupta and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2308.07918},
  year   = {2023}
}

备注

ICCV2023