中文

DinoTwins:结合 DINO 和 Barlow Twins 的强大、标签高效的视觉 Transformer

计算机视觉与模式识别 2025-08-26 v1 人工智能

摘要

训练能够理解图像的 AI 模型仍面临标签成本高的问题。我们将两种技术——DINO(教师-学生学习)和 Barlow Twins(冗余减少)——结合起来创建一个在更少标签和计算资源下学习得更好的模型。虽然 DINO 和 Barlow Twins 各自在自监督学习中都表现出色,但每种方法都存在局限——DINO 对某些数据增强方法敏感,Barlow Twins 通常需要过大的 batch 大小才能在消费级硬件上运行。通过将 Barlow Twins 的冗余减少目标与 DINO 的自蒸馏策略相结合,我们旨在利用两者的互补优势。我们在 MS COCO 数据集上训练混合模型,只使用 10% 标记数据进行线性探针测试,并将其性能与独立的 DINO 和 Barlow Twins 实现进行比较。初步结果表明,组合方法在损失和分类准确率方面与 DINO 相当,同时保持了强大的特征表示。注意力可视化进一步表明混合模型在语义分割方面的能力得到改善。这种结合的方法为在资源受限的环境中训练 ViT 提供了可扩展的、标签高效的替代方案。

引用

@article{arxiv.2508.17509,
  title  = {DinoTwins: Combining DINO and Barlow Twins for Robust, Label-Efficient Vision Transformers},
  author = {Michael Podsiadly and Brendon K Lay},
  journal= {arXiv preprint arXiv:2508.17509},
  year   = {2025}
}