混合饮食让 DINO 成为全能视觉编码器
计算机视觉与模式识别
2026-03-02 v1 人工智能
摘要
预训练的视觉编码器如 DINOv2 在单模态任务上表现卓越。然而,我们注意到其特征表示在不同模态之间 poorly 对齐。例如,RGB 图像和对应场景深度图的特征嵌入的余弦相似性几乎与两个随机无关图像的相似性相同。为此,我们提出 Omnivorous Vision Encoder(全能视觉编码器),一种学习模态不可辨特征空间的新框架。我们采用双目标进行训练:首先最大化不同模态相同场景特征之间的对齐;其次,采用锚定到完全冻结教师模型(如 DINOv2)输出的蒸馏目标。 resulting student 编码器通过产生一致且强大的嵌入来实现“全能”,无论输入是 RGB、Depth、Segmentation 等模态,都能为给定场景生成一致的强大嵌入。这种方法实现了鲁棒的跨模态理解,同时保留了原始基础模型的判别性语义。
引用
@article{arxiv.2602.24181,
title = {A Mixed Diet Makes DINO An Omnivorous Vision Encoder},
author = {Rishabh Kabra and Maks Ovsjanikov and Drew A. Hudson and Ye Xia and Skanda Koppula and Andre Araujo and Joao Carreira and Niloy J. Mitra},
journal= {arXiv preprint arXiv:2602.24181},
year = {2026}
}
备注
CVPR 2026