视觉对话的一种改进生成式评测
计算机视觉与模式识别
2020-04-27 v2 计算与语言
摘要
评测视觉对话(即针对视觉输入回答一系列问题的任务)仍是一项开放的研究挑战。VisDial 数据集当前的评测方案在预定义候选集中计算真实答案的排序,Massiceti 等人(2018)指出其易受数据集偏差利用的影响。该方案也几乎未考虑表达同一答案的不同方式——这一语言现象在 NLP 中已被充分研究。我们提出一种针对 VisDial 数据集的改进评测方案,借助 NLP 文献中的指标来衡量模型生成答案与一组相关答案间的共识。我们使用基于相关性的简单有效半监督方法构建这些相关答案集,从而能够将人类稀疏相关性标注自动扩展并扩展到整个数据集。我们以 DenseVisDial 发布这些集合及改进评测方案的代码,并期望它们能在现有约束与设计选择下改进该数据集。
引用
@article{arxiv.2004.09272,
title = {A Revised Generative Evaluation of Visual Dialogue},
author = {Daniela Massiceti and Viveka Kulharia and Puneet K. Dokania and N. Siddharth and Philip H. S. Torr},
journal= {arXiv preprint arXiv:2004.09272},
year = {2020}
}
备注
16 pages, 5 figures