中文

开放以自我为中心动作的词表

计算机视觉与模式识别 2023-12-13 v2

摘要

以自我为中心视频中的人类动作通常是手-物交互,由手执行的动词作用于物体构成。尽管规模大幅扩展,以自我为中心的数据集仍面临两个局限——动作组合稀疏以及交互物体为闭集。本文提出一种新颖的开放词表动作识别任务。给定训练期间观察到的动词和物体集合,目标是将动词泛化到包含已见和 novel(新颖)物体的开放词表动作。为此,我们通过物体无关动词编码器和基于提示的物体编码器解耦动词与物体预测。该提示利用 CLIP 表征来预测交互物体的开放词表。我们在 EPIC-KITCHENS-100 和 Assembly101 数据集上创建了开放词表基准;而闭集动作方法无法泛化,我们提出的方法则十分有效。此外,我们的物体编码器在识别新颖交互物体方面显著优于现有的开放词表视觉识别方法。

关键词

引用

@article{arxiv.2308.11488,
  title  = {Opening the Vocabulary of Egocentric Actions},
  author = {Dibyadip Chatterjee and Fadime Sener and Shugao Ma and Angela Yao},
  journal= {arXiv preprint arXiv:2308.11488},
  year   = {2023}
}

备注

NeurIPS 2023 camera ready; https://dibschat.github.io/openvocab-egoAR/