SigLino:高效多教师蒸馏的 agglomerative 视觉基础模型
计算机视觉与模式识别
2026-04-08 v2
摘要
通过多教师蒸馏训练的视觉基础模型为统一视觉表示提供了可行之路,但此类方法的学习动力学和数据效率仍未得到充分探索。本文系统性地研究了面向视觉基础模型的多教师蒸馏,识别实现低计算成本训练的关键因素。我们提出 SigLino,一套高效的 agglomerative 视觉基础模型,通过从 SigLIP2 和 DINOv3 同时蒸馏知识到 Dense 和 Mixture-of-Experts 学生模型中实现。我们表明:(1)我们的非对称关系-知识蒸馏损失保留了每个教师的几何属性,同时实现有效的知识传递;(2)token 平衡批处理将不同分辨率图像打包为统一 token 预算的序列,有助于在不同分辨率之间稳定表示学习,而不牺牲性能;(3)层次聚类和训练数据抽样——通常用于自监督学习——显著提高了多教师蒸馏的样本效率,优于随机抽样;(4)得到的表示能够有效迁移到早期融合的 Grounding-VLMs 上,优于从头训练的模型。通过结合这些发现,我们构建了 OpenLVD200M,一个包含 2000 万图像的语料库,证明了多教师蒸馏的优越效率。我们在 Mixture-of-Experts 中实现 SigLino-MoE,初始化一个取代常规 ViT->LLM 堆栈的早期融合 Grounding-VLM,性能优于从头训练的模型。我们发布 OpenLVD200M 和五个蒸馏检查点,包括 MoE 和密集变体。
引用
@article{arxiv.2512.20157,
title = {SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models},
author = {Sofian Chaybouti and Sanath Narayan and Yasser Dahou and Phúc H. Lê Khac and Ankit Singh and Ngoc Dung Huynh and Wamiq Reyaz Para and Hilde Kuehne and Hakim Hacid},
journal= {arXiv preprint arXiv:2512.20157},
year = {2026}
}
备注
17 pages, 8 figures, 11 tables