中文

基于对象接地视觉常识推理从开放世界自我中心视频中发现新动作

计算机视觉与模式识别 2024-05-06 v2

摘要

学习在开放世界中推断标签,即在目标“标签”未知的环境中,是实现自主性的重要特征。基础模型在海量数据上预训练,已通过提示展现出卓越的泛化能力,尤其在零样本推断中。然而,其性能受限于目标标签搜索空间的正确性,即提示中提供的候选标签。在开放世界中该目标搜索空间可能未知或极其庞大,严重制约其性能。为应对这一挑战,我们提出一种称为 ALGO 的两步神经-符号框架——基于接地对象识别的动作学习,利用大规模知识库中存储的符号知识,在有限监督下推断自我中心视频中的活动。首先,我们提出一种神经-符号提示方法,以对象为中心的视觉-语言模型作为噪声预言,通过基于证据的推理接地视频中的对象。其次,在已有常识知识驱动下,我们通过基于能量的符号模式理论框架发现合理活动,并学习将基于知识的动作(动词)概念接地于视频中。在四个公开数据集(EPIC-Kitchens、GTEA Gaze、GTEA Gaze Plus 和 Charades-Ego)上的大量实验证明了其在开放世界活动推断上的性能。我们还展示 ALGO 可扩展至零样本推断,并在 Charades-Ego 数据集上展现出有竞争力的性能。

关键词

引用

@article{arxiv.2305.16602,
  title  = {Discovering Novel Actions from Open World Egocentric Videos with Object-Grounded Visual Commonsense Reasoning},
  author = {Sanjoy Kundu and Shubham Trehan and Sathyanarayanan N. Aakur},
  journal= {arXiv preprint arXiv:2305.16602},
  year   = {2024}
}

备注

25 Pages, 4 figures, 3 tables