CPT:面向预训练视觉-语言模型的彩色提示微调
计算机视觉与模式识别
2022-05-23 v3 计算与语言
摘要
预训练视觉-语言模型(VL-PTM)已展现出将自然语言锚定于图像数据中的良好能力,支撑了广泛的跨模态任务。然而,我们注意到模型预训练与微调的目标形式之间存在显著差距,导致需要大量标注数据以激发VL-PTM面向下游任务的视觉锚定能力。为应对该挑战,我们提出跨模态提示微调(CPT,或称彩色提示微调),一种微调VL-PTM的新范式,其借助图像与文本中基于颜色的共同指称标记,将视觉锚定重构为填空问题,最大程度缩小差距。借此,CPT赋予VL-PTM强大的少样本乃至零样本视觉锚定能力。综合实验结果表明,提示微调后的VL-PTM大幅优于其微调对应模型(例如,在RefCOCO评估中单样本下绝对准确率提升17.3%,相对标准差平均降低73.8%)。我们已公开本文数据与代码:https://github.com/thunlp/CPT。
引用
@article{arxiv.2109.11797,
title = {CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Models},
author = {Yuan Yao and Ao Zhang and Zhengyan Zhang and Zhiyuan Liu and Tat-Seng Chua and Maosong Sun},
journal= {arXiv preprint arXiv:2109.11797},
year = {2022}
}
备注
Work in progress