APLe:面向多模态提示学习的逐令牌自适应方法
计算机视觉与模式识别
2024-01-24 v2 人工智能
计算与语言
摘要
预训练的视觉-语言(V-L)模型在下游任务泛化基准测试中表现突出,是值得关注的竞争者。现有研究已探索了V-L模型的许多特性,包括对文本输入的敏感性挑战以及跨多模态提示的调优过程。随着CLIP等V-L模型的高级应用,近期方法部署可学习提示而非手工提示,以提升泛化性能并应对上述挑战。受图像融合中广泛使用的逐层训练启发,我们注意到使用顺序训练过程来高效地适应CLIP的不同模态分支,有助于促进泛化能力的提升。在解决多模态提示挑战的背景下,我们提出了面向多模态提示学习的逐令牌自适应方法(APLe),以顺序方式将视觉和语言两种模态的提示作为令牌进行调优。APLe解决了V-L模型中的挑战,促进了跨两种模态的提示学习,显示出与最先进水平相当的竞争性泛化性能。尤为突出的是,APLe在提示长度实验中表现出鲁棒性和优异性能,在采用V-L模型方面具有绝对优势。
引用
@article{arxiv.2401.06827,
title = {APLe: Token-Wise Adaptive for Multi-Modal Prompt Learning},
author = {Guiming Cao and Kaize Shi and Hong Fu and Huaiwen Zhang and Guandong Xu},
journal= {arXiv preprint arXiv:2401.06827},
year = {2024}
}
备注
7 pages,3 figures