可迁移引导注意力是视频领域适应的关键——基于迁移注意力机制的Transformer框架
计算机视觉与模式识别
2024-09-18 v2
摘要
视频上游域适应(UDA)是一项备受关注的挑战性任务,相较于图像型UDA技术,相关研究仍显不足。尽管视觉Transformer(ViT)在众多计算机视觉任务中实现了最前沿性能,但其在视频UDA中的应用仍鲜有探索。我们的核心思想是将Transformer层用作特征编码器,并将空间和时间迁移关系纳入注意力机制之中。随后,我们构建了Transferable-guided Attention(TransferAttn)框架,以充分发挥Transformer在跨不同 backbone 之间传递跨域知识的能力。为提升ViT的迁移性,我们引入了一种新型且高效的模块——域迁移引导注意力块(Domain Transferable-guided Attention Block, DTAB)。DTAB通过将自注意力机制转化为迁移注意力机制,使ViT能够聚焦于视频帧之间的时空迁移关系。我们在UCF-HMDB、Kinetics-Gameplay和Kinetics-NEC Drone数据集上进行了大量实验,采用ResNet101、I3D和STAM等不同的backbone,以验证TransferAttn相较于当前最前沿方法的有效性。此外,我们还展示了DTAB可被应用于来自视频和图像领域的其他多种最前沿基于Transformer的UDA方法,能够带来性能提升。我们的代码已公开:https://github.com/Andre-Sacilotti/transferattn-project-code。
引用
@article{arxiv.2407.01375,
title = {Transferable-guided Attention Is All You Need for Video Domain Adaptation},
author = {André Sacilotti and Samuel Felipe dos Santos and Nicu Sebe and Jurandy Almeida},
journal= {arXiv preprint arXiv:2407.01375},
year = {2024}
}