AmPLe:通过自适应去偏集成多提示学习支持视觉语言模型
计算机视觉与模式识别
2025-12-23 v1 人工智能
摘要
多提示学习方法已成为有效促进视觉语言模型在资源有限的情况下适应下游任务的关键手段。现有多提示学习方法主要专注于在单一基础视觉语言模型内部利用各种精心设计的提示以实现卓越性能。然而,忽略的模型-提示匹配偏差阻碍了多提示学习的发展,即相同提示在不同视觉语言模型(如CLIP-ViT-B/16和CLIP-ViT-B/32)中可能传递不同的语义,从而导致对相同提示的预测不一致。为缓解此偏差对下游任务的影响,我们探索了集成学习方法,以充分聚合多样化预测的优势。此外,我们进一步揭示了样本-提示匹配偏差的存在,这源于输入样本中封装的与提示无关的语义。因此,直接利用输入样本的全部信息为生成集成学习权重会导致次优性能。为此,我们利用基于信息论的分析指导,从输入样本中提取与提示相关的语义,自适应计算去偏集成权重。总体而言,我们提出了自适应去偏集成多提示学习方法,简称为AmPLe,以同时缓解这两种偏差。广泛的实验在三个具有代表性的任务上表明,AmPLe能广泛超越现有方法。从因果学术视角进行的理论验证进一步支持了AmPLe的有效性。
引用
@article{arxiv.2512.18411,
title = {AmPLe: Supporting Vision-Language Models via Adaptive-Debiased Ensemble Multi-Prompt Learning},
author = {Fei Song and Yi Li and Jiangmeng Li and Rui Wang and Changwen Zheng and Fanjiang Xu and Hui Xiong},
journal= {arXiv preprint arXiv:2512.18411},
year = {2025}
}
备注
Accepted by IJCV2025