基于置信度 Distillation 的门控关系对齐:高效 Vision-Language 模型
计算机视觉与模式识别
2026-05-26 v4 人工智能
摘要
Vision-Language Models(VLMs)在多模态任务上取得强劲性能,但部署成本高昂,后训练量化常导致显著精度损失。尽管量化感知训练为 VLMs 提供了潜在可能,但其研究仍不足。我们提出 GRACE(Gated Relational Alignment via Confidence-based Distillation),一个统一知识蒸馏与 QAT 的框架,基于信息瓶颈原理:量化限制信息容量,而蒸馈指导在该预算内保留什么。将教师模型视为任务相关信息的代理,我们引入基于置信度的门控解耦蒸馈以过滤不可靠监督,引入关系中心化核对齐以传递视觉 token 结构,并通过拉格朗日松弛引入自适应控制器以平衡保真度与容量约束。我们在 LLaVA 与 Qwen 系列模型上进行大规模基准测试,INT4 模型持续超越 FP16 基准(如 LLaVA-1.5-7B 在 SQA 上 70.1 vs 66.8;Qwen2-VL-2B 在 MMBench 上 76.9 vs 72.6),几乎匹配教师性能。使用真实 INT4 kernel,我们实现 3 倍吞吐量并实现 54% 的内存降低。这一原则化框架显著优于现有量化方法,使 GRACE 成为资源受限部署的有力解决方案。代码与数据已公开:https://github.com/ForeverBlue816/GRACE。
引用
@article{arxiv.2601.22709,
title = {Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs},
author = {Yanlong Chen and Amirhossein Habibian and Luca Benini and Yawei Li},
journal= {arXiv preprint arXiv:2601.22709},
year = {2026}
}
备注
Accepted to the International Conference on Machine Learning (ICML 2026)