从维基百科分类中挖掘自然语言推理知识
计算与语言
2020-10-06 v1
摘要
准确的词汇蕴含(LE)和自然语言推理(NLI)通常需要大量昂贵的标注。为缓解对标注数据的需求,我们引入 WikiNLI:一种用于提升 NLI 和 LE 任务模型性能的资源。它包含 428,899 对短语,这些短语由维基百科中自然标注的分类层次结构构建而成。我们表明,通过在 WikiNLI 上预训练 BERT 和 RoBERTa 等强基线模型并将模型迁移至下游任务,可改进其性能。我们与从 WordNet 和 Wikidata 等其他知识库提取的短语进行系统比较,发现基于 WikiNLI 的预训练给出最佳性能。此外,我们以其他语言构建 WikiNLI,并表明在其上预训练可提升对应语言 NLI 任务的性能。
引用
@article{arxiv.2010.01239,
title = {Mining Knowledge for Natural Language Inference from Wikipedia Categories},
author = {Mingda Chen and Zewei Chu and Karl Stratos and Kevin Gimpel},
journal= {arXiv preprint arXiv:2010.01239},
year = {2020}
}
备注
Findings of EMNLP 2020