中文

Prompt-OT:视觉语言模型适配中知识保留的最优传输正则化范式

计算机视觉与模式识别 2025-12-02 v3 人工智能 计算与语言 多媒体

摘要

诸如 CLIP 之类的视觉语言模型表现出强大的性能,但在适配下游任务时面临困难。提示学习已成为一种高效且有效的策略,用于适配 VLMs 同时保留其预训练知识。然而,现有方法仍会导致过拟合并降低零样本泛化能力。为了应对这一挑战,我们提出了一种最优传输(OT)引导的提示学习框架,通过保持预训练模型与微调模型之间特征分布的结构一致性来缓解遗忘。与传统的逐点约束不同,OT 自然地捕获跨实例关系并扩展了提示调优的可行参数空间,从而在适配与泛化之间实现更好的权衡。我们的方法对视觉和文本表示均施加联合约束,确保整体的特征对齐。在基准数据集上的大量实验表明,我们简单而有效的方法在基类到新类泛化、跨数据集评估和域泛化方面优于现有的提示学习策略,且无需额外的数据增强或集成技术。代码可在 https://github.com/ChongQingNoSubway/Prompt-OT 获取

关键词

引用

@article{arxiv.2503.08906,
  title  = {Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation},
  author = {Xiwen Chen and Wenhui Zhu and Peijie Qiu and Hao Wang and Huayu Li and Haiyu Wu and Aristeidis Sotiras and Yalin Wang and Abolfazl Razi},
  journal= {arXiv preprint arXiv:2503.08906},
  year   = {2025}
}

备注

Accepted to WACV 2026