中文

从可听交互中学习状态感知的视觉表征

计算机视觉与模式识别 2022-09-28 v1

摘要

我们提出一种自监督算法,从以自我为中心的视频数据中学习表征。近来,人们已付出大量努力捕捉人类在日常活动中与自身环境的交互。由此,出现了若干包含丰富交互的多模态大规模自我中心数据集。然而,从视频中学习表征具有挑战性。首先,鉴于长时段连续视频未经筛选的性质,学习有效表征需要聚焦于交互发生的时间时刻。其次,日常活动的视觉表征应对环境状态的变化敏感。然而,当前成功的多模态学习框架鼓励表征随时间不变。为应对这些挑战,我们利用音频信号识别可能交互的时刻,以利于更好的学习。我们还提出一种新颖的自监督目标,从交互引起的可听状态变化中学习。我们在两个大规模自我中心数据集 EPIC-Kitchens-100 与近期发布的 Ego4D 上广泛验证了这些贡献,并展示了在若干下游任务(包括动作识别、长时段动作预期和物体状态变化分类)上的改进。

关键词

引用

@article{arxiv.2209.13583,
  title  = {Learning State-Aware Visual Representations from Audible Interactions},
  author = {Himangi Mittal and Pedro Morgado and Unnat Jain and Abhinav Gupta},
  journal= {arXiv preprint arXiv:2209.13583},
  year   = {2022}
}

备注

NeurIPS 2022. Code available at https://github.com/HimangiM/RepLAI