室外晴且暗?!通过蕴涵问题生成提升 VQA 中的回答一致性
计算机视觉与模式识别
2019-09-12 v1 人工智能
摘要
尽管视觉问答(VQA)模型多年来稳步改进,但与之交互很快会发现这些模型缺乏一致性。例如,若模型对“气球是什么颜色?”回答“红色”,当被问“气球是红色的吗?”时它可能回答“否”。这些响应违背了简单的蕴涵概念,并引发关于 VQA 模型如何有效 grounding 语言的疑问。在本工作中,我们引入一个数据集 ConVQA 以及能够对 VQA 一致性进行定量评估的指标。对图像中给定可观测事实(如气球的颜色),我们生成一组逻辑一致的问答(QA)对(如“气球是红色的吗?”),并收集一组基于常识的一致 QA 对人工标注(如“气球和番茄酱颜色相同吗?”)。此外,我们提出一个提升一致性的数据增强模块,即一致性教师模块(CTM)。CTM 为源 QA 对自动生成蕴涵(或相似意图)问题,若 VQA 对蕴涵问题的回答与源 QA 对一致,则微调 VQA 模型。我们证明基于 CTM 的训练提升了 VQA 模型在 ConVQA 数据集上的一致性,并是进一步研究的强基线。
引用
@article{arxiv.1909.04696,
title = {Sunny and Dark Outside?! Improving Answer Consistency in VQA through Entailed Question Generation},
author = {Arijit Ray and Karan Sikka and Ajay Divakaran and Stefan Lee and Giedrius Burachas},
journal= {arXiv preprint arXiv:1909.04696},
year = {2019}
}
备注
2019 Conference on Empirical Methods in Natural Language Processing (EMNLP 2019)