中文

ProCLIP:基于LLM的渐进式视觉语言对齐

计算机视觉与模式识别 2026-01-08 v3

摘要

原始CLIP文本编码器受限于最大输入长度为77个token,这阻碍了其有效处理长文本和进行细粒度语义理解的能力。此外,CLIP文本编码器不支持多语言输入。这些限制显著削弱了其在更广泛任务范围内的适用性。近期研究尝试以LLM为embedder取代CLIP文本编码器,以提升其处理长文本、多语言理解和细粒度语义理解的能力。然而,由于LLM和视觉语言空间的表示在预训练时独立构建且缺乏对齐先验,直接使用对比学习进行对齐会破坏CLIP图像编码器内在的视觉语言对齐,导致其在预训练期间获取的知识被低效利用。为此,我们提出ProCLIP,一种基于课程学习的渐进式视觉语言对齐框架,以有效对齐CLIP图像编码器与LLM-based embedder。具体而言,ProCLIP首先从CLIP文本编码器蒸馏知识至LLM-based embedder,以利用CLIP的丰富预训练知识,同时在LLM embedder与CLIP图像编码器之间建立初始对齐。随后,ProCLIP通过图像-文本对比调谐进一步对齐CLIP图像编码器与LLM-based embedder,采用自蒸馏正则化以避免过拟合。为实现更有效的对齐,在表示继承和对比调谋期间,均采用了实例语义对齐损失和嵌入结构对齐损失。代码已公开于 https://github.com/VisionXLab/ProCLIP。

关键词

引用

@article{arxiv.2510.18795,
  title  = {ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder},
  author = {Xiaoxing Hu and Kaicheng Yang and Ziyang Gong and Qi Ming and Zonghao Guo and Yu Tian and Xiang An and Ziyong Feng and Xue Yang},
  journal= {arXiv preprint arXiv:2510.18795},
  year   = {2026}
}

备注

17 pages, 5 fiugres