在视觉问答中生成推理依据
人工智能
2020-04-07 v1 计算与语言
计算机视觉与模式识别
摘要
尽管视觉问答(VQA)近期取得了进展,仍具挑战的是判断多少成功可归因于合理的推理与理解能力。我们试图通过提出一项新的推理依据生成任务来研究此问题。本质上,我们令 VQA 模型为其预测的答案为自身生成推理依据。我们使用来自视觉常识推理(VCR)任务的数据,因其包含真值推理依据以及视觉问题与答案。我们首先通过利用最先进的语言模型 GPT-2 从预训练权重生成推理依据,来考察领先 VCR 模型之一 ViLBERT 中的常识理解。接着,我们寻求以端到端方式联合训练 ViLBERT 与 GPT-2,承担 VQA 中预测答案与生成推理依据的双重任务。我们通过定量与定性评价指标表明,此类训练将常识理解注入到 VQA 模型中。
引用
@article{arxiv.2004.02032,
title = {Generating Rationales in Visual Question Answering},
author = {Hammad A. Ayyubi and Md. Mehrab Tanjim and Julian J. McAuley and Garrison W. Cottrell},
journal= {arXiv preprint arXiv:2004.02032},
year = {2020}
}