中文

从维基百科分类中挖掘自然语言推理知识

计算与语言 2020-10-06 v1

摘要

准确的词汇蕴含(LE)和自然语言推理(NLI)通常需要大量昂贵的标注。为缓解对标注数据的需求,我们引入 WikiNLI:一种用于提升 NLI 和 LE 任务模型性能的资源。它包含 428,899 对短语,这些短语由维基百科中自然标注的分类层次结构构建而成。我们表明,通过在 WikiNLI 上预训练 BERT 和 RoBERTa 等强基线模型并将模型迁移至下游任务,可改进其性能。我们与从 WordNet 和 Wikidata 等其他知识库提取的短语进行系统比较,发现基于 WikiNLI 的预训练给出最佳性能。此外,我们以其他语言构建 WikiNLI,并表明在其上预训练可提升对应语言 NLI 任务的性能。

关键词

引用

@article{arxiv.2010.01239,
  title  = {Mining Knowledge for Natural Language Inference from Wikipedia Categories},
  author = {Mingda Chen and Zewei Chu and Karl Stratos and Kevin Gimpel},
  journal= {arXiv preprint arXiv:2010.01239},
  year   = {2020}
}

备注

Findings of EMNLP 2020