视觉对话中的历史信息:我们真的需要它吗?
计算机视觉与模式识别
2020-05-18 v1 人工智能
计算与语言
机器学习
摘要
视觉对话(Visual Dialog)除了需要基于图像中的定位信息外,还涉及“理解”对话历史(先前讨论的内容)和当前问题(所询问的内容),以生成正确的回复。在本文中,我们表明,显式编码对话历史的协同注意力(co-attention)模型优于未编码的模型,取得了最先进的性能(验证集上 NDCG 为 72%)。然而,我们也通过表明历史信息实际上仅在一小部分数据中才是必需的,且当前的评估指标鼓励通用回复,从而暴露了众包数据集收集过程的缺陷。为此,我们提出了 VisDial 验证集的一个具有挑战性的子集(VisDialConv),并提供了 63% NDCG 的基准。
引用
@article{arxiv.2005.07493,
title = {History for Visual Dialog: Do we really need it?},
author = {Shubham Agarwal and Trung Bui and Joon-Young Lee and Ioannis Konstas and Verena Rieser},
journal= {arXiv preprint arXiv:2005.07493},
year = {2020}
}
备注
ACL'20