中文

重新审视跨域少样本学习中图像 Token 的连续性

计算机视觉与模式识别 2025-06-04 v1

摘要

Vision Transformer (ViT) 因在通用领域上的大规模预训练而取得了显著成功,但将其应用于仅有稀缺训练数据的下游远端领域时仍面临挑战,这催生了跨域少样本学习(CDFSL)任务。受 Self-Attention 对 token 顺序不敏感的启发,我们发现了一个现有工作所忽视的有趣现象:在 ViT 中破坏图像 token 的连续性(即令像素在 patch 之间不平滑过渡)会导致其在通用(源)域的性能显著下降,但在下游目标域的下降却微乎其微。这质疑了在巨大领域差距下图像 token 连续性在 ViT 泛化中的作用。在本文中,我们深入探讨这一现象以给出解释。我们发现连续性有助于 ViT 学习更大的空间模式,而这类模式比较小模式更难迁移,从而增大了领域距离。同时,这意味着在极端领域差距下,每个 patch 内仅有较小模式能够被迁移。基于这一解释,我们进一步提出了一种简单而有效的 CDFSL 方法,该方法更好地破坏了图像 token 的连续性,鼓励模型减少对大模式的依赖,转而更多依赖较小模式。大量实验表明,我们的方法在缩小领域差距和超越 SOTA 工作方面具有有效性。代码和模型可在 https://github.com/shuaiyi308/ReCIT 获取。

关键词

引用

@article{arxiv.2506.03110,
  title  = {Revisiting Continuity of Image Tokens for Cross-domain Few-shot Learning},
  author = {Shuai Yi and Yixiong Zou and Yuhua Li and Ruixuan Li},
  journal= {arXiv preprint arXiv:2506.03110},
  year   = {2025}
}

备注

Accepted by ICML 2025(spotlight)