中文

科学自然语言推理的 MISMATCHED 基准

计算与语言 2025-06-06 v1

摘要

科学自然语言推理(NLI)是预测从研究文章中提取的句子对之间的语义关系的任务。现有数据集来自计算机科学(CS)领域,而非CS领域完全被忽略。本文引入新的科学NLI评估基准,称为MISMATCHED。新的MISMATCHED基准覆盖PSYCHOLOGY、ENGINEERING和PUBLIC HEALTH三个非CS领域,包含2700个人工标注的句子对。我们使用预训练小型语言模型(SLMs)和大型语言模型(LLMs)在MISMATCHED上建立了强基线。我们最佳的基线仅达到78.17%的宏平均F1分,说明未来有大量提升空间。除了介绍MISMATCHED基准外,我们表明在模型训练中包含具有隐式科学NLI关系的句子对可提高其在科学NLI上的性能。我们将该数据集和代码公开于GitHub。

关键词

引用

@article{arxiv.2506.04603,
  title  = {A MISMATCHED Benchmark for Scientific Natural Language Inference},
  author = {Firoz Shaik and Mobashir Sadat and Nikita Gautam and Doina Caragea and Cornelia Caragea},
  journal= {arXiv preprint arXiv:2506.04603},
  year   = {2025}
}

备注

Accepted to Findings of ACL 2025