基于提示学习的非配对图像描述生成
计算机视觉与模式识别
2022-11-21 v2
摘要
非配对图像描述生成(UIC)旨在从未对齐的视觉-语言样本对中学习图像描述。现有工作通常使用基于强化学习的对抗学习和视觉概念奖励来解决该任务。然而,这些现有工作只能学习视觉和语言领域中有限的跨域信息,这限制了 UIC 的描述生成性能。受视觉-语言预训练模型(VL-PTMs)在此研究中的成功启发,我们尝试从大型 VL-PTMs 中推断关于给定图像的跨域线索信息以用于 UIC 任务。本研究也受到提示学习在许多下游多模态任务(包括图文检索和视觉问答)中近期成功的推动。在这项工作中,引入语义提示并与视觉特征聚合,以在对抗学习框架下实现更准确的描述预测。此外,设计度量提示以从基础描述模型中选择高质量伪图像-描述样本,并以迭代方式精炼模型。在 COCO 和 Flickr30K 数据集上的大量实验验证了所提模型良好的描述生成能力。我们期望所提出的基于提示的 UIC 模型将激发基于 VL-PTMs 的描述生成研究的新思路。
引用
@article{arxiv.2205.13125,
title = {Prompt-based Learning for Unpaired Image Captioning},
author = {Peipei Zhu and Xiao Wang and Lin Zhu and Zhenglong Sun and Weishi Zheng and Yaowei Wang and Changwen Chen},
journal= {arXiv preprint arXiv:2205.13125},
year = {2022}
}