面向视觉-语言模型的块-提示对齐贝叶斯提示微调
计算机视觉与模式识别
2024-07-02 v2 计算与语言
机器学习
摘要
对于视觉-语言预训练模型的下游应用,构建有效提示已引起极大关注。现有的提示工程工作要么需要繁琐的手动设计,要么将提示微调作为点估计问题来优化,可能难以刻画类别的多样特征并限制其应用。我们引入一种贝叶斯概率式提示微调方法,其中标签特定的随机提示通过先从潜在分布中采样潜向量、再使用轻量生成模型以层次化方式生成。重要的是,我们通过最小化视觉块与语言提示之间的统计距离对微调过程进行语义正则化,从而推动随机标签表示忠实捕捉多样的视觉概念,而非过拟合训练类别。我们在四项任务上评估了方法的有效性:少样本图像识别、基到新泛化、数据集迁移学习和域偏移。在 15 个数据集上的大量结果表明,我们提出的模型在定量与定性上均具备良好的可迁移性与泛化性能。
引用
@article{arxiv.2303.09100,
title = {Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models},
author = {Xinyang Liu and Dongsheng Wang and Bowei Fang and Miaoge Li and Zhibin Duan and Yishi Xu and Bo Chen and Mingyuan Zhou},
journal= {arXiv preprint arXiv:2303.09100},
year = {2024}
}
备注
Accepted by UAI 2024