DINORANKCLIP:用于视觉-语言预训练的DINOv3蒸馏与注入及高阶排序一致性
计算机视觉与模式识别
2026-05-08 v1 人工智能
机器学习
摘要
对比语言-图像预训练(CLIP)存在两个结构性弱点:对称的InfoNCE损失丢弃了未匹配批内对之间的相对顺序,而全局池化将视觉表示压缩成对细粒度局部结构不敏感的语义瓶颈。RANKCLIP通过列表式Plackett-Luce排序一致性损失部分解决了第一个问题,但其模型严格为一阶,且未触及第二个弱点。我们提出了DINORANKCLIP,一个联合解决这两个问题的预训练框架。我们的主要贡献是通过双分支轻量级学生模型和具有通道-空间注意力的多尺度融合模块、自注意力精炼器以及冲突感知门,将冻结的DINOv3教师注入到对比主干中,该冲突感知门可保持高达一阶的跨模态对齐。作为补充,我们引入了一个高阶Plackett-Luce排序模型,其中每个位置的效用通过注意力参数化的成对和元组式转移项进行了增强;该族包含CLIP和RANKCLIP作为嵌套的零阶和一阶特例,并且在每个基准测试上的最优阶数为 。完整的实证研究——阶数扫描、五个数据集上的Fine-grained Probe、四节点Modality-Gap分析、六变体Fusion消融——在单个八GPU H100节点上72小时内完成,并完全在Conceptual Captions 3M上训练。在匹配的计算量下,DINORANKCLIP始终优于CLIP、CyCLIP、ALIP和RANKCLIP,在最直接考验局部结构推理的细粒度和分布外评估上取得了最大的相对增益。
引用
@article{arxiv.2605.06592,
title = {DINORANKCLIP: DINOv3 Distillation and Injection for Vision-Language Pretraining with High-Order Ranking Consistency},
author = {Shuyang Jiang and Nan Yu and Yiming Zhang and Zenghui Ding and Zhenyu Wu},
journal= {arXiv preprint arXiv:2605.06592},
year = {2026}
}
备注
18 pages, 7 figures, 9 tables. Code will be made publicly available upon acceptance