PLOT:面向视觉-语言模型的基于最优传输的提示学习
计算机视觉与模式识别
2023-02-13 v2 计算与语言
机器学习
摘要
随着 CLIP 等大型视觉-语言模型受到越来越多的关注,构建高效提示的工作已得到大量投入。与仅学习单一提示的传统方法不同,我们提出学习多个综合性提示,以描述类别的多样特征,如内在属性或外在上下文。然而,直接将每个提示与同一视觉特征匹配是有问题的,因为这会推动各提示收敛到一点。为解决该问题,我们提出应用最优传输来匹配视觉与文本模态。具体而言,我们首先用视觉与文本特征集合对图像和类别建模。然后,我们采用两阶段优化策略来学习提示。在内循环中,我们通过 Sinkhorn 算法优化最优传输距离以对齐视觉特征与提示;而在外循环中,我们依据该距离从监督数据中学习提示。在少样本识别任务上进行了充分实验,其改进表明了本方法的优越性。代码见 https://github.com/CHENGY12/PLOT。
引用
@article{arxiv.2210.01253,
title = {PLOT: Prompt Learning with Optimal Transport for Vision-Language Models},
author = {Guangyi Chen and Weiran Yao and Xiangchen Song and Xinyue Li and Yongming Rao and Kun Zhang},
journal= {arXiv preprint arXiv:2210.01253},
year = {2023}
}
备注
ICLR 2023, Spotlight