中文

Co-VQA:通过交互式子问题序列进行回答

计算与语言 2022-04-05 v1

摘要

大多数现有的视觉问答(VQA)方法直接回答问题,然而人们通常会将复杂问题分解为一系列简单子问题,并在回答子问题序列(SQS)后最终获得原问题的答案。通过模拟该过程,本文提出一种基于对话的 VQA(Co-VQA)框架,由提问者、回答 oracle 和作答者三部分组成。提问者使用扩展的 HRED 模型提出子问题,oracle 逐一作答。我们还提出了一种用于作答者的自适应链式视觉推理模型(ACVRM),其中问答对被用于顺序更新视觉表示。为对每个模型进行监督学习,我们引入了一种精心设计的方法,在 VQA 2.0 和 VQA-CP v2 数据集上为每个问题构建 SQS。实验结果表明,我们的方法在 VQA-CP v2 上达到了最先进水平(SOTA)。进一步分析表明,SQS 有助于建立问题与图像之间的直接语义连接,提供问题自适应的变长推理链,并具有明确的可解释性与错误可追溯性。

关键词

引用

@article{arxiv.2204.00879,
  title  = {Co-VQA : Answering by Interactive Sub Question Sequence},
  author = {Ruonan Wang and Yuxi Qian and Fangxiang Feng and Xiaojie Wang and Huixing Jiang},
  journal= {arXiv preprint arXiv:2204.00879},
  year   = {2022}
}

备注

Accepted by Findings of ACL 2022