跨视频域的音频自适应活动识别
计算机视觉与模式识别
2022-03-30 v2
摘要
本文致力于域偏移下的活动识别,例如由场景或相机视角变化引起的偏移。主流方法通过对抗训练与自监督学习减小活动外观上的偏移。不同于这些以视觉为中心的工作,我们利用活动声音进行域适应,因其跨域方差较小且能可靠指示哪些活动未发生。我们提出一种音频自适应编码器及相应学习方法,判别性地调整视觉特征表示并应对语义分布上的偏移。为进一步消除域特定特征并引入域不变的活动声音用于识别,提出一种音频融合识别器,有效建模跨域的跨模态交互。我们还引入了参与者偏移这一新任务及相应的音视频数据集,以活动外观剧变的情形挑战我们的方法。在該数据集、EPIC-Kitchens 与 CharadesEgo 上的实验显示了方法的有效性。
引用
@article{arxiv.2203.14240,
title = {Audio-Adaptive Activity Recognition Across Video Domains},
author = {Yunhua Zhang and Hazel Doughty and Ling Shao and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2203.14240},
year = {2022}
}
备注
Accepted at CVPR 2022