什么 DINO 看见:ALiBi 位置编码减少 Vision Transformer 中的位置偏差
计算机视觉与模式识别
2026-03-18 v1 材料科学
摘要
Vision Transformer(ViT)——尤其是像 DINOv2 这样的特征基础模型——学习了对许多下游任务有用的丰富表征。然而,架构选择(如位置编码)可能导致这些模型在语义内容独立于位置的前提下显示位置偏差和人为痕迹。这使得在诸如材料科学等领域进行零样本适应变得困难,因为该领域的图像通常是均匀微结构的横截面(即没有特定偏好方向)。在本 work 中,我们通过线性探针检验 ViT 中的位置偏差,发现其在广泛的目标和位置编码中均存在,并随后通过微调模型以 ALiBi 相对位置编码来减少其偏差。我们展示了这些模型保留了理想的通用语义,其无偏特征可成功用于复杂显微镜图像的可训练分割。
引用
@article{arxiv.2603.16840,
title = {What DINO saw: ALiBi positional encoding reduces positional bias in Vision Transformers},
author = {Moritz Pawlowsky and Antonis Vamvakeros and Alexander Weiss and Anja Bielefeld and Samuel J. Cooper and Ronan Docherty},
journal= {arXiv preprint arXiv:2603.16840},
year = {2026}
}