通过学习时间一致性实现无源视频域自适应以用于动作识别
计算机视觉与模式识别
2022-07-12 v4
摘要
基于视频的无监督域自适应(VUDA)方法提升了视频模型的鲁棒性,使其可应用于跨环境的动作识别任务。然而,这些方法在自适应过程中需要持续访问源数据。但在许多现实应用中,源视频域中的主体与场景应和目标视频域中的无关。随着对数据隐私的日益重视,此类需访问源数据的方法会引发严重的隐私问题。因此,为应对该关切,一种更实用的域自适应场景被定义为无源基于视频的域自适应(SFVDA)。尽管已有少量针对图像数据的无源域自适应(SFDA)方法,但由于视频的多模态特性及额外时间特征的存在,这些方法在 SFVDA 中性能退化。本文中,我们提出一种新颖的注意力时间一致网络(ATCoN),通过学习时间一致性来解决 SFVDA,该一致性由两项新颖的一致性目标保证,即特征一致性与源预测一致性,在局部时间特征上执行。ATCoN 进一步基于预测置信度关注局部时间特征,从而构建有效的整体时间特征。实证结果表明,ATCoN 在各种跨域动作识别基准上取得了最先进的性能。
引用
@article{arxiv.2203.04559,
title = {Source-free Video Domain Adaptation by Learning Temporal Consistency for Action Recognition},
author = {Yuecong Xu and Jianfei Yang and Haozhi Cao and Keyu Wu and Wu Min and Zhenghua Chen},
journal= {arXiv preprint arXiv:2203.04559},
year = {2022}
}
备注
Accepted by ECCV 2022, update to camera-ready version with updated title. 22 pages, 5 figures, 7 tables