中文

建设性构造干扰项:创建更优视觉问答数据集的经验教训

计算与语言 2018-06-12 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

视觉问答(Visual QA)近来备受关注,本质上被视为人工智能应力求实现的一种(视觉)图灵测试。本文研究该任务的一个关键组成部分:如何为任务设计良好的数据集?我们聚焦于基于多选题的数据集设计,其中学习器需从一组候选答案中选出正确答案,候选包括目标答案(\ie 正确项)与干扰答案(\ie 错误项)。通过对现有数据集上最先进(state-of-the-art)学习模型与人类标注者所得结果的细致分析,我们发现干扰答案的设计对学习模型从数据集中学习的方式与内容有显著影响。具体而言,由此得到的学习器可以忽略视觉信息、问题或两者,却仍能在任务中表现良好。受此启发,我们提出自动程序来补救此类设计缺陷。我们将这些程序应用于重构两个流行Visual QA数据集的干扰答案,并基于Visual Genome项目创建一个新的Visual QA数据集,从而构建了该任务迄今最大的数据集。大量实证研究表明,修复后数据集中的设计缺陷已得到缓解,且其上的性能更可能忠实反映不同学习模型间的差异。数据集已发布并通过 http://www.teds.usc.edu/website_vqa/ 公开获取。

关键词

引用

@article{arxiv.1704.07121,
  title  = {Being Negative but Constructively: Lessons Learnt from Creating Better Visual Question Answering Datasets},
  author = {Wei-Lun Chao and Hexiang Hu and Fei Sha},
  journal= {arXiv preprint arXiv:1704.07121},
  year   = {2018}
}

备注

Accepted for Oral Presentation at NAACL-HLT 2018