e-ViL:视觉-语言任务中自然语言解释的基准数据集与评测框架
计算机视觉与模式识别
2021-08-19 v2 计算与语言
机器学习
摘要
近年来,越来越多的研究致力于提出能够为视觉-语言(VL)任务预测生成自然语言解释(NLEs)的模型。这类模型颇具吸引力,因为它们可以提供人性化且全面的解释。然而,由于缺乏可复用的评测框架以及数据集的匮乏,现有方法之间缺乏比较。在本工作中,我们引入了 e-ViL 和 e-SNLI-VE。e-ViL 是一个面向可解释视觉-语言任务的基准,它建立了统一的评测框架,并首次对现有为 VL 任务生成 NLEs 的方法进行了全面比较。它涵盖四种模型和三个数据集,并同时使用自动指标与人工评测来评估模型生成的解释。e-SNLI-VE 是目前最大的带 NLEs 的 VL 数据集(超过 43 万条实例)。我们还提出了一种新模型,它结合了学习图像与文本联合嵌入的 UNITER,以及擅长文本生成的预训练语言模型 GPT-2。该模型在所有数据集上大幅超越了此前的 SOTA。代码与数据见:https://github.com/maximek3/e-ViL。
引用
@article{arxiv.2105.03761,
title = {e-ViL: A Dataset and Benchmark for Natural Language Explanations in Vision-Language Tasks},
author = {Maxime Kayser and Oana-Maria Camburu and Leonard Salewski and Cornelius Emde and Virginie Do and Zeynep Akata and Thomas Lukasiewicz},
journal= {arXiv preprint arXiv:2105.03761},
year = {2021}
}
备注
Accepted at ICCV 2021 (camera-ready version)