中文

RADIOv2.5:面向聚合式视觉基础模型的改进基线

计算机视觉与模式识别 2025-02-11 v2 人工智能

摘要

聚合式模型最近已成为训练视觉基础模型的一种强大方法,它利用来自 CLIP、DINO 和 SAM 等现有模型的多教师蒸馏。这种策略能够高效地创建鲁棒模型,结合了各个教师的优势,同时显著降低了计算和资源需求。在本文中,我们深入分析了当前最优的聚合式模型,识别出关键挑战,包括分辨率模式偏移、教师不平衡、独特的教师伪影以及过多的输出词元。为解决这些问题,我们提出了几种新颖的解决方案:多分辨率训练、马赛克增强以及改进的教师损失函数平衡。具体而言,在视觉语言模型的背景下,我们引入了一种词元压缩技术,以在固定的词元数量内保持高分辨率信息。我们发布了在多个规模(-B、-L、-H 和 -g)上的性能最佳变体,以及推理代码和预训练权重。

关键词

引用

@article{arxiv.2412.07679,
  title  = {RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models},
  author = {Greg Heinrich and Mike Ranzinger and Hongxu and Yin and Yao Lu and Jan Kautz and Andrew Tao and Bryan Catanzaro and Pavlo Molchanov},
  journal= {arXiv preprint arXiv:2412.07679},
  year   = {2025}
}