科学自然语言推理的 MISMATCHED 基准
计算与语言
2025-06-06 v1
摘要
科学自然语言推理(NLI)是预测从研究文章中提取的句子对之间的语义关系的任务。现有数据集来自计算机科学(CS)领域,而非CS领域完全被忽略。本文引入新的科学NLI评估基准,称为MISMATCHED。新的MISMATCHED基准覆盖PSYCHOLOGY、ENGINEERING和PUBLIC HEALTH三个非CS领域,包含2700个人工标注的句子对。我们使用预训练小型语言模型(SLMs)和大型语言模型(LLMs)在MISMATCHED上建立了强基线。我们最佳的基线仅达到78.17%的宏平均F1分,说明未来有大量提升空间。除了介绍MISMATCHED基准外,我们表明在模型训练中包含具有隐式科学NLI关系的句子对可提高其在科学NLI上的性能。我们将该数据集和代码公开于GitHub。
引用
@article{arxiv.2506.04603,
title = {A MISMATCHED Benchmark for Scientific Natural Language Inference},
author = {Firoz Shaik and Mobashir Sadat and Nikita Gautam and Doina Caragea and Cornelia Caragea},
journal= {arXiv preprint arXiv:2506.04603},
year = {2025}
}
备注
Accepted to Findings of ACL 2025