中文

TernaryCLIP:基于三值权重和蒸馏知识的高效视觉语言模型压缩方法

计算机视觉与模式识别 2025-10-28 v1 人工智能

摘要

近年来,图像-文本对比建模受到了广泛关注,如 Contrastive Language-Image Pretraining (CLIP) 等模型。本文提出了 TernaryCLIP,这是一个轻量级计算框架,将 CLIP 的视觉编码器和文本编码器的连接权重转换为三值格式,而非全精度或浮点格式。TernaryCLIP 集成了量化感知训练和蒸馏模块,防止精度降级,实现低成本高效计算。全面实验表明,TernaryCLIP 可实现最高达99%的权重三值化,仅需1.58位表示,实现16.98倍压缩比,2.3倍推理加速,16倍存储降低,10倍内存优化,同时保持60%的稀疏度,在41个常用数据集上维持良好的零样本图像分类和图像-文本检索性能。我们的工作强调了大型多模态模型极端量化的可行性,支持在资源受限设备上实现有效且高效的部署。该模型和代码可在 Hugging Face 和 GitHub 上获取。

关键词

引用

@article{arxiv.2510.21879,
  title  = {TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge},
  author = {Shu-Hao Zhang and Wei-Cheng Tang and Chen Wu and Peng Hu and Nan Li and Liang-Jie Zhang and Qi Zhang and Shao-Qun Zhang},
  journal= {arXiv preprint arXiv:2510.21879},
  year   = {2025}
}