基于相对范数对齐的跨域第一人称视听动作识别
计算机视觉与模式识别
2021-06-04 v1
摘要
随着可穿戴摄像机的日益普及,第一人称动作识别成为一个研究越来越多的课题。这也凸显了在此背景下尚待解决的跨域问题。事实上,从学习到的表示中提取的信息带有内在的环境偏差。这严重影响了向未知场景的泛化能力,限制了当前方法在训练期间无法获得裁剪标注数据的真实场景中的应用。在本工作中,我们提出利用视听信号内在互补的特性来学习一种在训练所见数据上表现良好、同时能够跨不同域泛化的表示。为此,我们引入了一种视听损失,通过对两种模态的特征范数表示的幅值起作用,来对齐来自这两个模态的贡献。这一新损失被嵌入一个极简的多模态动作识别架构中,在跨域第一人称动作识别上取得了强劲结果,正如在流行的 EPIC-Kitchens 数据集上开展的广泛实验所证明的那样。
引用
@article{arxiv.2106.01689,
title = {Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment},
author = {Mirco Planamente and Chiara Plizzari and Emanuele Alberti and Barbara Caputo},
journal= {arXiv preprint arXiv:2106.01689},
year = {2021}
}
备注
11 pages, 7 figures