中文

ChatGPT提问,BLIP-2作答:面向丰富视觉描述自动提问

计算机视觉与模式识别 2023-03-14 v1 人工智能 机器学习

摘要

提出有见地的问题对于获取知识和拓展对世界的理解至关重要。然而,提问的重要性在AI研究中长期被忽视,模型主要被开发用来回答问题。随着ChatGPT等大型语言模型(LLMs)的近期进展,我们发现其在给定合适提示时能提出高质量问题。这一发现为开发自动提问系统提供了新机遇。本文中,我们介绍ChatCaptioner,一种部署于图像字幕生成的新型自动提问方法。此处,ChatGPT被提示向强大的视觉问答模型BLIP-2提出一系列关于图像的信息性问题。通过不断从BLIP-2的回答中获取新视觉信息,ChatCaptioner能够生成更丰富的图像描述。我们在COCO、Conceptual Caption和WikiArt等常见图像字幕数据集上进行了人工评估,并将ChatCaptioner与BLIP-2及真实标注进行比较。结果表明,ChatCaptioner的描述信息量显著更高,在提供最多图像信息方面获得人类评估者三倍投票。此外,通过WordNet同义词集匹配衡量,ChatCaptioner比单独BLIP-2多识别53%的图像内物体。代码见https://github.com/Vision-CAIR/ChatCaptioner

关键词

引用

@article{arxiv.2303.06594,
  title  = {ChatGPT Asks, BLIP-2 Answers: Automatic Questioning Towards Enriched Visual Descriptions},
  author = {Deyao Zhu and Jun Chen and Kilichbek Haydarov and Xiaoqian Shen and Wenxuan Zhang and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2303.06594},
  year   = {2023}
}