中文

SciNLI:面向科学文本的自然语言推理语料库

计算与语言 2022-03-16 v2

摘要

现有的自然语言推理(NLI)数据集虽推动了自然语言理解(NLU)研究的发展,但均与科学文本无关。本文引入 SciNLI,一个大规模 NLI 数据集,其捕捉科学文本中的正式性,包含从 NLP 与计算语言学的学术论文中提取的 107,412 个句子对。鉴于科学文献所用文本在日常语言的词汇与句子结构方面均与之差异巨大,我们的数据集非常适合作为科学 NLU 模型评估的基准。实验表明 SciNLI 比现有 NLI 数据集更难分类。我们以 XLNet 的最佳性能模型仅取得 78.18% 的宏 F1 分数与 78.23% 的准确率,显示仍有较大改进空间。

关键词

引用

@article{arxiv.2203.06728,
  title  = {SciNLI: A Corpus for Natural Language Inference on Scientific Text},
  author = {Mobashir Sadat and Cornelia Caragea},
  journal= {arXiv preprint arXiv:2203.06728},
  year   = {2022}
}