中文

面向动作识别中视频Transformer的无监督域适应

计算机视觉与模式识别 2022-07-27 v1

摘要

近年来,无监督域适应(UDA)技术在计算机视觉中获得了显著的重视与普及。然而,与图像领域丰富的文献相比,视频领域仍相对未被充分探索。另一方面,动作识别模型的性能受域偏移影响严重。本文提出一种简洁而新颖的面向视频动作识别的UDA方法。我们的方法利用时空Transformer的最新进展构建鲁棒的来源模型,从而更好地泛化至目标域。此外,得益于引入基于信息瓶颈原理的新型对齐损失项,我们的架构学习到域不变特征。我们在两个UDA视频动作识别基准上报告结果,在HMDB\leftrightarrowUCF以及更具挑战性的Kinetics\rightarrowNEC-Drone上均展示了最先进的性能。这证明了我们的方法在处理不同级别域偏移时的有效性。源代码见 https://github.com/vturrisi/UDAVT。

关键词

引用

@article{arxiv.2207.12842,
  title  = {Unsupervised Domain Adaptation for Video Transformers in Action Recognition},
  author = {Victor G. Turrisi da Costa and Giacomo Zara and Paolo Rota and Thiago Oliveira-Santos and Nicu Sebe and Vittorio Murino and Elisa Ricci},
  journal= {arXiv preprint arXiv:2207.12842},
  year   = {2022}
}

备注

Accepted at ICPR 2022