中文

知识引导学习:面向零监督开放域自我中心动作识别

计算机视觉与模式识别 2022-03-15 v2 人工智能

摘要

深度学习的进展使得能够开发在视频中表现出显著动作识别甚至定位倾向的模型。然而,当面对超出其初始训练环境的场景或样本时,它们往往会出现错误。因此,若无大量标注数据的重要重训练,它们无法适应新域。本文中,我们提出通过转向开放世界设定,解耦识别与推理的思想来克服这些局限。基于Grenander模式理论形式化所提供的组合表示,我们展示了在开放世界设定下,注意力和常识知识可用于自我中心视频中新颖动作的自主监督发现,其中来自观测环境(目标域)的数据是开放的,即词汇表部分已知且训练样本(有标注和无标注)均不可用。我们展示了我们的方法能够推断并学习自我中心视频中开放词汇分类的新颖类别,以及零监督的新颖物体检测。大量实验表明,在开放世界条件下,其在两个公开可用的自我中心动作识别数据集(GTEA Gaze和GTEA Gaze+)上具有竞争性性能。

关键词

引用

@article{arxiv.2009.07470,
  title  = {Knowledge Guided Learning: Towards Open Domain Egocentric Action Recognition with Zero Supervision},
  author = {Sathyanarayanan N. Aakur and Sanjoy Kundu and Nikhil Gunti},
  journal= {arXiv preprint arXiv:2009.07470},
  year   = {2022}
}

备注

Pattern Recognition Lettters