基于历史推理:上下文感知的视觉对话
计算与语言
2020-11-03 v1
摘要
尽管神经模型在单轮视觉问答(VQA)任务上表现出色,但将VQA扩展到多轮对话场景仍具挑战。应对该挑战的一种方法是,用能够保留先前对话轮次信息的机制来增强现有的强神经VQA模型。MAC网络是一种强VQA模型,它将任务分解为一系列基于注意力的推理步骤。然而,由于MAC网络是为单轮问答设计的,它无法指代过去的对话轮次。更具体地说,它在需要基于对话历史进行推理的任务(尤其是共指消解)上表现不佳。我们通过上下文感知注意力与记忆(CAM)扩展MAC网络架构,其关注过去对话轮次中的控制状态,以确定当前问题所需的推理操作。带有CAM的MAC网络在CLEVR-Dialog数据集上达到高达98.25%的准确率,比现有最优水平绝对提升30%。我们的误差分析表明,借助CAM,模型在需要共指消解的问题上性能尤其得到改善。
引用
@article{arxiv.2011.00669,
title = {Reasoning Over History: Context Aware Visual Dialog},
author = {Muhammad A. Shah and Shikib Mehri and Tejas Srinivasan},
journal= {arXiv preprint arXiv:2011.00669},
year = {2020}
}
备注
Accepted to NLP Beyond Text workshop, EMNLP 2020