DARK:基于对角锚定的排斥知识蒸馏,用于极端压缩下的视觉语言模型
计算机视觉与模式识别
2026-05-08 v3 人工智能
机器学习
摘要
面向临床场景的视觉语言模型压缩至设备端日益重要,但当教师-学生容量差跨越一个数量级以上时,知识蒸馏(KD)性能会急剧下降。我们认为,在此类容量差下,严格模仿教师是一个糟糕的目标:教师的两两相似性结构大量反映了其自身的架构偏见,而非紧凑学生能高效表示的信息。我们提出了**基于对角锚定的排斥知识蒸馏(DARK)**,一种对比式KD框架,将蒸馏损失分解为对角项(匹配的图像-文本对)和非对角项(非目标相似性)。对角项在整个训练过程中锚定匹配对的对齐;非对角项从正权重逐渐 annealing 为负权重,使学生从模仿过渡到**排斥**教师的非目标相似性结构。我们通过将 FetalCLIP(4.27 亿参数胎儿超声视觉语言模型)蒸馏为**MobileFetalCLIP**(7500 万参数学生模型,视觉编码器缩小 ,在 iPhone 16 Pro 上仅需 1.6ms)实现了 DARK。该学生模型在三个零样本基准测试中与教师相当或更好,包括 HC18 生物测量有效性(88.6% vs. 83.5%)和脑干平面 F1 分数(0.784 vs. 0.702)。嵌入几何与逻辑分析表明,DARK 诱导**结构性去相关**:学生在保持与教师一致的 per-image 置信度的同时,与继承的类别间混淆发生偏离,表明在极端压缩下,受控排斥可能比模仿更高效。
引用
@article{arxiv.2603.05421,
title = {DARK: Diagonal-Anchored Repulsive Knowledge Distillation for Vision-Language Models under Extreme Compression},
author = {Numan Saeed and Asif Hanif and Fadillah Adamsyah Maani and Hussain Alasmawi and Mohammad Yaqub},
journal= {arXiv preprint arXiv:2603.05421},
year = {2026}
}
备注
Project website: www.numansaeed.com/mobilefetalclip