在视觉常识推理中强化推理
计算机视觉与模式识别
2019-12-30 v2 人工智能
计算与语言
机器学习
摘要
视觉常识推理(Visual Commonsense Reasoning)任务极具挑战性,因为模型不仅必须能够给定图像回答一个问题,还必须学会推理。该任务中引入的基线方法存在较大局限,因为其使用两个网络分别预测答案与理由。答案预测网络以问题与图像为输入进行训练,而理由预测网络以问题、图像与正确答案作为 input。由于理由以正确答案为条件,该方法基于一个假设:我们可以无任何误差地解决视觉问答(Visual Question Answering, VQA)任务——这过于理想化。此外,这种方法使答案与理由预测成为两个完全独立的VQA任务,令认知任务失去意义。本文中,我们试图通过提出一个端到端可训练模型来解决这些问题,该模型联合考虑答案及其理由。具体而言,我们先预测问题的答案,再利用所选答案预测理由。然而,此类模型的朴素设计会导致不可微分,从而难以训练。我们通过提出四种方法解决该问题——softmax、gumbel-softmax、基于强化学习的采样以及针对所有答案-理由对的直接交叉熵。我们通过实验证明,我们的模型与当前最先进(state-of-the-art, SOTA)方法相比具有竞争力。我们以对所述方法的分析作结,并探讨进一步研究的方向。
引用
@article{arxiv.1910.11124,
title = {Enforcing Reasoning in Visual Commonsense Reasoning},
author = {Hammad A. Ayyubi and Md. Mehrab Tanjim and David J. Kriegman},
journal= {arXiv preprint arXiv:1910.11124},
year = {2019}
}