中文

跨视频域的音频自适应活动识别

计算机视觉与模式识别 2022-03-30 v2

摘要

本文致力于域偏移下的活动识别,例如由场景或相机视角变化引起的偏移。主流方法通过对抗训练与自监督学习减小活动外观上的偏移。不同于这些以视觉为中心的工作,我们利用活动声音进行域适应,因其跨域方差较小且能可靠指示哪些活动未发生。我们提出一种音频自适应编码器及相应学习方法,判别性地调整视觉特征表示并应对语义分布上的偏移。为进一步消除域特定特征并引入域不变的活动声音用于识别,提出一种音频融合识别器,有效建模跨域的跨模态交互。我们还引入了参与者偏移这一新任务及相应的音视频数据集,以活动外观剧变的情形挑战我们的方法。在該数据集、EPIC-Kitchens 与 CharadesEgo 上的实验显示了方法的有效性。

关键词

引用

@article{arxiv.2203.14240,
  title  = {Audio-Adaptive Activity Recognition Across Video Domains},
  author = {Yunhua Zhang and Hazel Doughty and Ling Shao and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2203.14240},
  year   = {2022}
}

备注

Accepted at CVPR 2022