用于跨域少样本学习的随机寄存器
计算机视觉与模式识别
2025-06-04 v1
摘要
跨域少样本学习(Cross-domain few-shot learning, CDFSL)旨在将知识从数据充足的源域迁移到数据稀缺的目标域。尽管 Vision Transformer (ViT) 在许多视觉任务中展现出卓越能力,但其在 CDFSL 中面对巨大领域鸿沟时的可迁移性仍未被充分探索。在本文中,我们发现了一个有趣的现象:在源域训练期间,作为训练 ViT 的常见方式,提示微调可能对 ViT 在目标域的泛化有害,但将其设为随机噪声(即随机寄存器)却能持续提升目标域的性能。随后我们深入探讨这一现象以寻求解释。我们发现,可学习的提示在源数据集训练期间捕获了领域信息,将无关的视觉模式视为识别的重要线索。这可以被视为一种过拟合,并增加了损失景观的锐度。相比之下,随机寄存器本质上是一种用于锐度感知最小化的新型注意力扰动方式,这有助于模型在损失景观中找到平缓的最小值,从而提高可迁移性。基于这一现象和解释,我们进一步提出了一种简单但有效的 CDFSL 方法,通过在图像 token 的语义区域添加随机寄存器来增强对注意力图的扰动,提升了随机寄存器的有效性和效率。在四个基准上的大量实验验证了我们的机理和 SOTA 性能。代码和模型可在 https://github.com/shuaiyi308/REAP 获取。
引用
@article{arxiv.2506.02843,
title = {Random Registers for Cross-Domain Few-Shot Learning},
author = {Shuai Yi and Yixiong Zou and Yuhua Li and Ruixuan Li},
journal= {arXiv preprint arXiv:2506.02843},
year = {2025}
}
备注
Accepted by ICML 2025