中文

InfoVisDial:通过桥接大型多模态与语言模型构建信息丰富的视觉对话数据集

计算机视觉与模式识别 2023-12-22 v1 人工智能

摘要

在本文中,我们构建了一个名为 InfoVisDial 的视觉对话数据集,该数据集在每一轮对话中均提供包含外部知识且与信息丰富的视觉内容相关的丰富 informative 答案。不同于现有数据集中紧凑且简短的回答,InfoVisDial 在每一轮对话中均包含信息量大的长自由形式回答。为实现高效的数据收集,核心思想是桥接大规模多模态模型(如 GIT)与语言模型(如 GPT-3)。GIT 能够描述图像内容(包括场景文本),而 GPT-3 则能基于图像描述和适当的提示技术生成信息丰富的对话。借助这种自动化流程,我们可以轻松大规模生成信息丰富的视觉对话数据。随后,我们邀请人工标注者对生成的对话进行评分,以过滤低质量对话。人工分析表明,InfoVisDial 涵盖了信息丰富且多样的对话主题:54.4%54.4\%的对话轮次与图像场景文本相关,36.7%36.7\%需要外部知识。每轮回答也具有长且开放的特点:87.3%87.3\%的回答是唯一的,平均长度为8.98.9,相比之下 VisDial 中这两项指标分别为27.37%27.37\%2.92.9。最后,我们通过适配 GIT 模型用于视觉对话任务并在 InfoVisDial 上进行微调,提出了一个强基线模型。希望我们的工作能激发更多针对该方向的努力。

关键词

引用

@article{arxiv.2312.13503,
  title  = {InfoVisDial: An Informative Visual Dialogue Dataset by Bridging Large Multimodal and Language Models},
  author = {Bingbing Wen and Zhengyuan Yang and Jianfeng Wang and Zhe Gan and Bill Howe and Lijuan Wang},
  journal= {arXiv preprint arXiv:2312.13503},
  year   = {2023}
}