中文

视觉对话的一种改进生成式评测

计算机视觉与模式识别 2020-04-27 v2 计算与语言

摘要

评测视觉对话(即针对视觉输入回答一系列问题的任务)仍是一项开放的研究挑战。VisDial 数据集当前的评测方案在预定义候选集中计算真实答案的排序,Massiceti 等人(2018)指出其易受数据集偏差利用的影响。该方案也几乎未考虑表达同一答案的不同方式——这一语言现象在 NLP 中已被充分研究。我们提出一种针对 VisDial 数据集的改进评测方案,借助 NLP 文献中的指标来衡量模型生成答案与一组相关答案间的共识。我们使用基于相关性的简单有效半监督方法构建这些相关答案集,从而能够将人类稀疏相关性标注自动扩展并扩展到整个数据集。我们以 DenseVisDial 发布这些集合及改进评测方案的代码,并期望它们能在现有约束与设计选择下改进该数据集。

关键词

引用

@article{arxiv.2004.09272,
  title  = {A Revised Generative Evaluation of Visual Dialogue},
  author = {Daniela Massiceti and Viveka Kulharia and Puneet K. Dokania and N. Siddharth and Philip H. S. Torr},
  journal= {arXiv preprint arXiv:2004.09272},
  year   = {2020}
}

备注

16 pages, 5 figures