中文

通过提示实现可控图像描述生成

计算机视觉与模式识别 2022-12-06 v1

摘要

尽管图像描述生成取得了显著进展,现有的描述生成器通常缺乏生成所需图像描述的可控能力,例如以粗略或详细的方式、以事实性或情感性视角等描述图像。在本文中,我们展示了一个统一模型能够在多样领域中表现良好并自由切换多种风格。这种可控能力通过将提示学习嵌入图像描述生成框架中实现。具体而言,我们设计了一组提示来微调预训练的图像描述生成器。这些提示使模型能够从不同领域吸收风格化数据以进行联合训练,且在各领域性能不退化。此外,我们在连续词嵌入空间中使用可学习向量优化提示,避免了启发式提示工程,同时展现出优越性能。在推理阶段,我们的模型能够通过选择相应提示生成所需的风格化描述。大量实验验证了所提方法的可控能力。值得注意的是,我们使用统一模型在包括 COCO Karpathy split 和 TextCaps 的两个不同图像描述生成基准上取得了出色性能。

关键词

引用

@article{arxiv.2212.01803,
  title  = {Controllable Image Captioning via Prompting},
  author = {Ning Wang and Jiahao Xie and Jihao Wu and Mingbo Jia and Linlin Li},
  journal= {arXiv preprint arXiv:2212.01803},
  year   = {2022}
}

备注

To appear in AAAI 2023