中文

面向对比语言-图像预训练模型的数据无关量化框架 D4C

计算机视觉与模式识别 2026-04-02 v2 机器学习

摘要

数据无关量化(DFQ)提供了一种无需访问真实数据即可进行模型压缩的实用方案,尤其适用于隐私敏感场景。尽管DFQ在单模态模型上已显示出前景,但其扩展至视觉-语言模型,如对比语言-图像预训练(CLIP)模型,仍未得到充分探索。本文揭示了,直接将现有DFQ技术应用于CLIP会导致显著性能下降,原因在于两个关键限制:合成样本的语义内容不足以及图像内部多样性低。为解决这些挑战,我们提出了D4C,即首个专为CLIP设计的DFQ框架。D4C通过三个关键组件合成语义丰富且结构多样的伪图像:1)提示引导语义注入对齐生成图像与真实世界语义;2)结构对比生成复现自然图像的组成结构;3)扰动感知增强通过受控扰动提升样本多样性与鲁棒性。这些组件共同使D4C能够合成既语义丰富又结构多样的图像,有效弥合DFQ在CLIP上性能差距。大量实验验证了D4C的有效性,在各种位宽和模型上均实现显著性能提升。

关键词

引用

@article{arxiv.2511.15411,
  title  = {D4C: Data-Free Quantization for Contrastive Language-Image Pre-training Models},
  author = {Wenlun Zhang and Yunshan Zhong and Zihao Ding and Xinyu Li and Kentaro Yoshioka},
  journal= {arXiv preprint arXiv:2511.15411},
  year   = {2026}
}

备注

Accepted to CVPRF 2026