PCaM:一种基于渐进式注意力的信息融合方法,用于改进视觉 Transformer 域适应
机器学习
2025-06-24 v1 人工智能
计算机视觉与模式识别
摘要
无监督域适应 (UDA) 旨在将来自标记源域的知识迁移到未标记的目标域。基于视觉 Transformer (ViT) 的最近 UDA 方法通过基于注意力的特征对齐取得了强大的性能。然而,我们识别出了一个关键局限性:前景物体不匹配,即跨域前景物体大小和空间分布的差异削弱了注意力一致性并阻碍了有效的域对齐。为解决此问题,我们提出了渐进式聚焦交叉注意力机制 (PCaM),该机制在交叉注意力期间逐渐过滤背景信息,使模型能够专注于并跨域融合判别性前景语义。我们进一步引入了注意力引导损失,显式地将注意力引导 toward任务相关区域,从而增强跨域注意力一致性。PCaM 轻量级、与体系结构无关,易于集成到现有的 ViT-based UDA 流水线中。大量实验在 Office-Home、DomainNet、VisDA-2017 和遥感数据集上表明,PCaM 在改进适应性能方面显著优于基线方法,并取得了新的状态-Of-The-Art 结果,验证了基于注意力引导的前景融合对域适应的有效性。
引用
@article{arxiv.2506.17232,
title = {PCaM: A Progressive Focus Attention-Based Information Fusion Method for Improving Vision Transformer Domain Adaptation},
author = {Zelin Zang and Fei Wang and Liangyu Li and Jinlin Wu and Chunshui Zhao and Zhen Lei and Baigui Sun},
journal= {arXiv preprint arXiv:2506.17232},
year = {2025}
}