基于陈述句的提示微调用于视觉问答
计算机视觉与模式识别
2022-05-06 v1 人工智能
多媒体
摘要
近年来,预训练—再微调范式在包括视觉问答(VQA)在内的广泛跨模态任务上取得了巨大成功:视觉—语言(VL)模型首先通过自监督任务目标(如掩码语言建模(MLM)和图文匹配(ITM))进行优化,然后通过全新目标函数(如答案预测)微调以适配下游任务(如 VQA)。目标形式的不一致不仅严重限制了预训练 VL 模型对下游任务的泛化能力,还需要大量标注数据用于微调。为缓解该问题,我们提出一种创新的 VL 微调范式(称为基于陈述句的提示微调,简称 DPT),其联合优化 VQA 模型的预训练与微调目标,促进预训练 VL 模型对下游任务的有效适配。具体而言,DPT 通过(1)文本适配,将给定问题转化为陈述句形式用于提示微调,以及(2)任务适配,以预训练阶段的方式优化 VQA 问题的目标函数,来重构 VQA 任务的目标形式。在 GQA 数据集上的实验结果表明,DPT 在全监督(2.68%)和零样本/少样本(超过 31%)设置下准确率均大幅优于微调对照方法。所有数据与代码将公开以促进未来研究。
引用
@article{arxiv.2205.02456,
title = {Declaration-based Prompt Tuning for Visual Question Answering},
author = {Yuhang Liu and Wei Wei and Daowan Peng and Feida Zhu},
journal= {arXiv preprint arXiv:2205.02456},
year = {2022}
}
备注
Accepted to IJCAI2022, data and codes are available at https://github.com/CCIIPLab/DPT