II-MMR:视觉问答中多模态多跳推理的识别与改进
计算机视觉与模式识别
2024-06-04 v3 计算与语言
摘要
视觉问答通常涉及视觉与语言(V&L)领域的多种推理场景。然而,以往的大多数 VQA 研究仅侧重于评估模型的整体准确率,而未能在不同推理情况上进行评估。此外,最近的一些工作观察到,传统的思维链提示无法为 VQA 生成有效的推理,特别是在需要多跳推理的复杂场景中。在本文中,我们提出了 II-MMR,一种在 VQA 中识别并改进多模态多跳推理的新思想。具体而言,II-MMR 接收一个带有图像的 VQA 问题,并使用两种新颖的语言提示找到到达其答案的推理路径: 答案预测引导的 CoT 提示,或 知识三元组引导的提示。然后,II-MMR 通过估计回答该问题需要多少跳以及何种类型(即视觉或超越视觉)的推理来分析此路径,以识别当前 VQA 基准测试中的不同推理情况。在包括 GQA 和 A-OKVQA 在内的流行基准测试中,II-MMR 观察到它们的大多数 VQA 问题很容易回答,仅需“单跳”推理,而只有少数问题需要“多跳”推理。此外,虽然最近的 V&L 模型即使使用传统的 CoT 方法也难以处理此类复杂的多跳推理问题,但 II-MMR 在零样本和微调设置下的所有推理情况中都展示了其有效性。
引用
@article{arxiv.2402.11058,
title = {II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering},
author = {Jihyung Kil and Farideh Tavazoee and Dongyeop Kang and Joo-Kyung Kim},
journal= {arXiv preprint arXiv:2402.11058},
year = {2024}
}
备注
Accepted to ACL 2024 Findings