从图像为多模态助手生成自然问题
计算机视觉与模式识别
2020-12-08 v1 人工智能
计算与语言
机器学习
摘要
从图像生成自然、多样且有意义的提问是多模态助手的一项基本任务,因为它能确认助手是否正确理解了图像中的物体与场景。视觉问答(VQA)与视觉问题生成(VQG)的研究是重要的一步。然而,这些研究并未涵盖有视觉能力的人会向多模态助手提出的问题。近期发布的 KB-VQA、FVQA 和 OK-VQA 等数据集试图收集寻求外部知识的问题,使其适用于多模态助手。但它们仍包含许多人类通常不会向数字助手提出的显而易见与常识性问题。本文提供了一个新的基准数据集,其中包含人类标注员在设想他们会向多模态数字助手提问时所生成的问题。对数十万张图像的大规模标注昂贵且耗时,因此我们也提出了一种从未见图像自动生成问题的有效方法。本文提出一种考虑图像内容与图像元数据(如位置、关联关键词)来生成多样且有意义问题的方法。我们使用 BLEU、METEOR、ROUGE 和 CIDEr 等标准评价指标评估所提方法,以显示生成问题与人工提供问题的相关性。我们还使用生成强度与创造性指标衡量生成问题的多样性。我们在公开数据集与我们的数据集上报告了新的最先进(SOTA)结果。
引用
@article{arxiv.2012.03678,
title = {Generating Natural Questions from Images for Multimodal Assistants},
author = {Alkesh Patel and Akanksha Bindal and Hadas Kotek and Christopher Klein and Jason Williams},
journal= {arXiv preprint arXiv:2012.03678},
year = {2020}
}
备注
4 pages, 1 reference page, 5 figures, 4 tables