中文

面向多模态测试时自适应的注意力自举

人工智能 2025-03-05 v1

摘要

测试时自适应旨在仅使用无标签测试数据,使训练良好的模型在测试时适应潜在的分布偏移,而无需访问原始训练数据。以往的尝试主要集中在单一模态上,而多模态场景下的测试时分布偏移更为复杂,需要新的解决方案。本文通过提出一种名为基于主熵最小化的注意力自举(ABPEM)的新方法,解决了多模态测试时自适应问题。我们观察到,测试时分布偏移导致模态之间错配,使得模态内差异(由自注意力测量)与模态间差异(由交叉注意力测量)之间存在较大差距。我们将此称为注意力差距。这种注意力差距随着分布偏移的加剧而扩大,阻碍了有效的模态融合。为了缓解这一注意力差距并促进更好的模态融合,我们提出了在自注意力引导下促进交叉注意力的注意力自举方法。此外,为了减少常用熵最小化中的梯度噪声,我们采用了主熵最小化,这是对熵最小化的一种改进,通过关注熵的主要部分并排除不太可靠的梯度信息来减少梯度噪声。在基准数据集上的大量实验验证了所提出的 ABPEM 与竞争基线相比的有效性。

关键词

引用

@article{arxiv.2503.02221,
  title  = {Attention Bootstrapping for Multi-Modal Test-Time Adaptation},
  author = {Yusheng Zhao and Junyu Luo and Xiao Luo and Jinsheng Huang and Jingyang Yuan and Zhiping Xiao and Ming Zhang},
  journal= {arXiv preprint arXiv:2503.02221},
  year   = {2025}
}