中文

用于可解释视觉问答的检索增强自然语言推理

计算机视觉与模式识别 2024-09-02 v1

摘要

带有自然语言解释的视觉问答(VQA-NLE)任务因对基于推理的推断要求极高而具有挑战性。近期的VQA-NLE研究侧重于增强模型网络以放大模型的推理能力,但这种方法消耗资源且不稳定。在本工作中,我们引入了一种新的VQA-NLE模型——ReRe(检索增强自然语言推理),利用从记忆中检索的信息来辅助生成准确的答案和具有说服力的解释,而无需依赖复杂的网络和额外的数据集。ReRe是一种编码器-解码器架构模型,使用预训练的CLIP视觉编码器和预训练的GPT-2语言模型作为解码器。在GPT-2中添加了交叉注意力层以处理检索特征。ReRe在VQA准确率和解释得分上优于以往方法,并在NLE方面展现出更具说服力和可靠性的改进。

关键词

引用

@article{arxiv.2408.17006,
  title  = {Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering},
  author = {Su Hyeon Lim and Minkuk Kim and Hyeon Bae Kim and Seong Tae Kim},
  journal= {arXiv preprint arXiv:2408.17006},
  year   = {2024}
}

备注

ICIP Workshop 2024