面向生物医学的鸾句体推理评估框架——SylloBio-NLI
计算与语言
2025-02-11 v2
摘要
鸾句体推理是自然语言推理 (NLI) 中的关键能力。这一能力在生物医学等专业领域尤为重要,可支持自动化证据解读与科学发现。本文提出了 SylloBio-NLI,一种新型框架,利用外部本体法系统化实例化多样化的鸾句体论证,以用于生物医学 NLI。我们采用 SylloBio-NLI 对大型语言模型 (LLM) 在识别有效结论和提取支持证据方面进行评估,涵盖 28 种鸾句体方案,这些方案基于人类基因通路实现。大量实验表明,生物医学鸾句体推理对零样本 LLM 而言尤其具有挑战性,零样本 LLM 在广义演绎演绎法和析取演绎法上的平均准确率分别为 70% 和 23%。同时,我们发现少样本提示可提升不同 LLM 的性能,包括 Gemma (+14%) 和 LLama-3 (+43%)。然而,更深入的分析显示,这两种技术对表面词汇变体高度敏感,这表明可靠性、模型架构和预训练方案之间存在依赖关系。总体而言,结果表明尽管情境示例有望在 LLM 中激发鸾句体推理能力,但现有模型距离实现面向生物医学 NLI 应用所需的鲁健性和一致性仍有很大的差距。
引用
@article{arxiv.2410.14399,
title = {SylloBio-NLI: Evaluating Large Language Models on Biomedical Syllogistic Reasoning},
author = {Magdalena Wysocka and Danilo Carvalho and Oskar Wysocki and Marco Valentino and Andre Freitas},
journal= {arXiv preprint arXiv:2410.14399},
year = {2025}
}