中文

面向视觉语言基础模型的后预训练模态对齐

计算机视觉与模式识别 2025-04-18 v1 人工智能 机器学习

摘要

对比式语言-图像预训练(CLIP)是构建现代视觉语言基础模型的 essential 组件。虽然 CLIP 在下游任务上显示出惊人的零样本性能,但多模态特征空间仍存在模态间隙——即图像和文本特征聚类之间的差距——限制了下游任务性能。虽然现有工作通过修改预训练或微调来解决模态间隙,但它们在大数据集上面临高昂的训练成本,或在零样本性能方面出现退化。本文提出了 CLIP-Refine,这是一种位于预训练与微调之间阶段的 CLIP 模型后预训练方法。CLIP-Refine 旨在在不降低零样本性能的前提下,对特征空间进行对齐。为此,我们引入两种技术:随机特征对齐(RaFA)和混合对比-蒸馏(HyCD)。RaFA 通过最小化到从先验分布中采样的随机参考向量的距离,将图像和文本特征对齐到共享的先验分布。HyCD 使用将 ground-truth 图像-文本对标签与预训练 CLIP 模型输出结合生成的混合软标签来更新模型。这有助于既保持已有知识,又学习新知识以实现特征对齐。我们进行了大量实验,涵盖多个分类和检索任务,结果表明 CLIP-Refine 成功减轻了模态间隙,提高了零样本性能。

关键词

引用

@article{arxiv.2504.12717,
  title  = {Post-pre-training for Modality Alignment in Vision-Language Foundation Models},
  author = {Shin'ya Yamaguchi and Dewei Feng and Sekitoshi Kanai and Kazuki Adachi and Daiki Chijiwa},
  journal= {arXiv preprint arXiv:2504.12717},
  year   = {2025}
}

备注

Accepted to CVPR 2025; Code: https://github.com/yshinya6/clip-refine