e-SNLI-VE:带自然语言解释且修正的视觉-文本蕴含数据集
计算与语言
2021-08-20 v3 人工智能
计算机视觉与模式识别
摘要
最近提出的用于识别视觉-文本蕴含的 SNLI-VE 语料库是一个大规模真实世界数据集,用于细粒度多模态推理。然而,SNLI-VE 的自动构建方式(通过组合两个相关数据集的部分)导致该语料库标签中存在大量错误。在本文中,我们首先提出一项数据收集工作,以修正 SNLI-VE 中错误率最高的类别。其次,我们在修正后的语料库(我们称之为 SNLI-VE-2.0)上重新评估一个已有模型,并提供其与在未修正语料库上性能的定量比较。第三,我们引入 e-SNLI-VE,它将人工撰写的自然语言解释附加到 SNLI-VE-2.0 上。最后,我们训练在训练时从这些解释中学习、并在测试时输出此类解释的模型。
引用
@article{arxiv.2004.03744,
title = {e-SNLI-VE: Corrected Visual-Textual Entailment with Natural Language Explanations},
author = {Virginie Do and Oana-Maria Camburu and Zeynep Akata and Thomas Lukasiewicz},
journal= {arXiv preprint arXiv:2004.03744},
year = {2021}
}