中文

基于视听相对范数对齐的第一人称动作识别域泛化方法

计算机视觉与模式识别 2022-04-21 v1

摘要

随着可穿戴摄像机的日益普及,第一人称动作识别正成为一个被越来越多研究的领域。这也揭示了在此背景下尚待解决的跨域问题。事实上,从学习到的表示中提取的信息存在内在的“环境偏差”。这严重影响了泛化到未见场景的能力,限制了当前方法在训练期间无标注数据可用的真实环境中的应用。在本工作中,我们提出了首个针对以自我为中心的活动识别的域泛化方法,通过提出一种称为相对范数对齐损失(Relative Norm Alignment loss)的新视听损失。它通过在不同域上对齐特征范数表示,在训练期间重新平衡来自两种模态的贡献。我们的方法在 EPIC-Kitchens-55 和 EPIC-Kitchens-100 上的域泛化中取得了强劲结果,广泛实验证明了这一点,并且可扩展至域适应设置中并取得有竞争力的结果。

关键词

引用

@article{arxiv.2110.10101,
  title  = {Domain Generalization through Audio-Visual Relative Norm Alignment in First Person Action Recognition},
  author = {Mirco Planamente and Chiara Plizzari and Emanuele Alberti and Barbara Caputo},
  journal= {arXiv preprint arXiv:2110.10101},
  year   = {2022}
}

备注

Accepted at WACV 2022. arXiv admin note: substantial text overlap with arXiv:2106.01689