面向动作识别中视频Transformer的无监督域适应
计算机视觉与模式识别
2022-07-27 v1
摘要
近年来,无监督域适应(UDA)技术在计算机视觉中获得了显著的重视与普及。然而,与图像领域丰富的文献相比,视频领域仍相对未被充分探索。另一方面,动作识别模型的性能受域偏移影响严重。本文提出一种简洁而新颖的面向视频动作识别的UDA方法。我们的方法利用时空Transformer的最新进展构建鲁棒的来源模型,从而更好地泛化至目标域。此外,得益于引入基于信息瓶颈原理的新型对齐损失项,我们的架构学习到域不变特征。我们在两个UDA视频动作识别基准上报告结果,在HMDBUCF以及更具挑战性的KineticsNEC-Drone上均展示了最先进的性能。这证明了我们的方法在处理不同级别域偏移时的有效性。源代码见 https://github.com/vturrisi/UDAVT。
引用
@article{arxiv.2207.12842,
title = {Unsupervised Domain Adaptation for Video Transformers in Action Recognition},
author = {Victor G. Turrisi da Costa and Giacomo Zara and Paolo Rota and Thiago Oliveira-Santos and Nicu Sebe and Vittorio Murino and Elisa Ricci},
journal= {arXiv preprint arXiv:2207.12842},
year = {2022}
}
备注
Accepted at ICPR 2022