中文

差分向量均衡化:用于面向视觉语言模型鲁棒微调的 robust 方法

计算机视觉与模式识别 2025-11-14 v1 人工智能

摘要

对比式预训练的视觉语言模型,如CLIP,在零样本分类中展示出强大的泛化能力,利用从图像和文本编码器中提取的嵌入。本文旨在可靠地在分布内(ID)数据上微调这些视觉语言模型,而不损害其在分布外(OOD)和零样本设置下的泛化能力。当前的鲁棒微调方法通过复用预训练中使用的对比学习来应对这一挑战。然而,我们发现这些方法会扭曲视觉语言模型嵌入的几何结构,而该结构在模型的泛化中起着关键作用,导致OD和零样本性能受限。为此,我们提出了差分向量均衡化(DiVE),在微调期间保持嵌入的几何结构。DiVE的思想是约束差分向量,这些差分向量通过对同一数据样本从预训练模型和微调模型中提取的嵌入进行减法获得。通过将差分向量在各种数据样本之间相等化,我们有效地保持了几何结构。因此,我们引入了两种损失:平均向量损失(AVL)和成对向量损失(PVL)。AVL通过将差分向量约束为其加权平均值来在全局层面保持几何结构。PVL通过确保一致的多模态对齐来在局部层面保持几何结构。我们的实验表明,DiVE有效地保持了几何结构,在ID、OOD和零样本指标方面取得了优异的成绩。

关键词

引用

@article{arxiv.2511.09973,
  title  = {Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models},
  author = {Satoshi Suzuki and Shin'ya Yamaguchi and Shoichiro Takeda and Taiga Yamane and Naoki Makishima and Naotaka Kawata and Mana Ihori and Tomohiro Tanaka and Shota Orihashi and Ryo Masumura},
  journal= {arXiv preprint arXiv:2511.09973},
  year   = {2025}
}

备注

Accepted by AAAI 2026