中文

SOS!自我中心动作识别中基于接触物体集合的自监督学习

计算机视觉与模式识别 2022-05-04 v2 人工智能 机器学习

摘要

从视频数据中学习自我中心动作识别模型具有挑战性,因为背景中存在干扰物(例如无关物体)。因此,将物体信息进一步整合到动作模型中是有益的。现有方法常利用通用物体检测器来识别并表示场景中的物体。然而,仍存在若干重要问题。为目标领域(数据集)学习良好的物体表征仍需要高质量的物体类别标注。此外,先前的方法将现有动作模型深度耦合,并需与物体表征联合重训练,导致成本高且集成不灵活。为克服这两类局限,我们提出基于集合的自监督学习(SOS),一种利用现成手-物接触检测器从视频物体区域预训练通用接触中物体(OIC)表征模型的方法。与常规自监督学习单独增强物体区域不同,我们将动作过程视为具有独特时空连续性的自然数据变换手段,并利用各视频物体集合间的内在关系。在 EPIC-KITCHENS-100 和 EGTEA 两个数据集上的大量实验表明,我们的 OIC 显著提升了多个最先进视频分类模型的性能。

关键词

引用

@article{arxiv.2204.04796,
  title  = {SOS! Self-supervised Learning Over Sets Of Handled Objects In Egocentric Action Recognition},
  author = {Victor Escorcia and Ricardo Guerrero and Xiatian Zhu and Brais Martinez},
  journal= {arXiv preprint arXiv:2204.04796},
  year   = {2022}
}