ConVQG:基于多模态引导的对比式视觉问题生成
计算机视觉与模式识别
2024-02-21 v1 人工智能
摘要
针对视觉环境提问是智能体理解丰富多面场景的关键方式,凸显了视觉问题生成(Visual Question Generation, VQG)系统的重要性。除了以图像为基准外,现有的 VQG 系统还可以利用文本约束(如预期答案或知识三元组)来生成聚焦的问题。这些约束允许 VQG 系统指定问题内容,或利用仅从图像内容中无法获取的外部常识知识。然而,在使用文本约束生成聚焦问题的同时确保与图像内容的高度相关性仍然是一个挑战,因为 VQG 系统往往忽略了一种或两种基准形式。在本工作中,我们提出了对比式视觉问题生成(Contrastive Visual Question Generation, ConVQG)方法,该方法利用双重对比目标,区分基于双模态生成的问题与基于单模态生成的问题。在知识感知型和标准 VQG 基准上的实验表明,ConVQG 优于最先进(state-of-the-art)的方法,并能生成基于图像基准、文本引导且知识丰富的问题。我们的人工评估结果也显示,相较于非对比基线,人们更偏好 ConVQG 生成的问题。
引用
@article{arxiv.2402.12846,
title = {ConVQG: Contrastive Visual Question Generation with Multimodal Guidance},
author = {Li Mi and Syrielle Montariol and Javiera Castillo-Navarro and Xianjie Dai and Antoine Bosselut and Devis Tuia},
journal= {arXiv preprint arXiv:2402.12846},
year = {2024}
}
备注
AAAI 2024. Project page at https://limirs.github.io/ConVQG