DocNLI:一个用于文档级自然语言推理的大规模数据集
计算与语言
2021-06-18 v1
摘要
自然语言推理(NLI)被表述为解决关系抽取、问答、摘要等各种 NLP 问题的统一框架。由于大规模标注数据集的可用,过去几年中它得到了深入研究。然而,大多数现有研究仅关注句子级推理,这限制了 NLI 在下游 NLP 问题中的应用范围。本工作提出 DocNLI——一个新建构的用于文档级 NLI 的大规模数据集。DocNLI 由广泛的 NLP 问题转换而来,并涵盖多种文本体裁。前提始终保持在文档粒度,而假设长度从单句到数百词段落不等。此外,DocNLI 具有相当有限的伪迹,而不幸的是这些伪迹在一些流行的句子级 NLI 数据集中广泛存在。我们的实验表明,即使不进行微调,在 DocNLI 上预训练的模型在流行的句子级基准上也展现出有前景的性能,并且能很好地泛化到依赖于文档粒度推理的域外 NLP 任务。任务特定微调可带来进一步改进。数据、代码和预训练模型可在 https://github.com/salesforce/DocNLI 找到。
引用
@article{arxiv.2106.09449,
title = {DocNLI: A Large-scale Dataset for Document-level Natural Language Inference},
author = {Wenpeng Yin and Dragomir Radev and Caiming Xiong},
journal= {arXiv preprint arXiv:2106.09449},
year = {2021}
}
备注
ACL'21 Findings Camera-ready