基于交互式提示的以文本数据为中心的图像描述生成
计算机视觉与模式识别
2024-03-29 v1
摘要
有监督的图像描述生成方法取得了巨大进展,但收集高质量的人工标注图文数据具有挑战性。最近,大规模视觉与语言模型(如 CLIP)和大规模生成式语言模型(如 GPT-2)在各种任务中表现出色,这也为利用网络配对数据、非配对数据甚至纯文本数据进行图像描述生成提供了新的解决方案。其中,主流解决方案是借助 CLIP 模型中图文对之间的一致表示,将图像嵌入投影到文本嵌入空间。然而,当前方法在以统一解决方案适应数据配置的多样性、准确估计图文嵌入偏差以及在推理阶段纠正不理想的预测结果方面仍面临若干挑战。本文提出了一种新的基于交互式提示的以文本数据为中心的图像描述生成方法,命名为 TIPCap。1) 我们考虑了四种不同的设置,逐步减少对配对数据的依赖。2) 我们构建了一个由多元高斯分布驱动的映射模块来缓解模态鸿沟,该模块适用于上述四种不同设置。3) 我们提出了一个提示交互模块,可以在生成描述之前引入可选的提示信息。大量实验表明,我们的 TIPCap 优于其他弱监督或无监督图像描述生成方法,并在两个广泛使用的数据集(即 MS-COCO 和 Flickr30K)上取得了新的 SOTA 性能。
引用
@article{arxiv.2403.19193,
title = {Text Data-Centric Image Captioning with Interactive Prompts},
author = {Yiyu Wang and Hao Luo and Jungang Xu and Yingfei Sun and Fan Wang},
journal= {arXiv preprint arXiv:2403.19193},
year = {2024}
}