AnesSuite:面向大语言模型的麻醉推理的全方位基准与数据集套件
计算与语言
2026-03-03 v4
摘要
大语言模型(LLM)在医学领域的应用引发了广泛关注,但其在更专业的学科领域,如麻醉学中的推理能力仍受到忽视。为弥合这一差距,我们介绍AnesSuite,即首个专为评估大语言模型在麻醉学推理而设计的全面数据集套件。该套件包含AnesBench,一个针对评估麻醉相关推理的基准测试,涵盖三个层次:事实性检索(System 1)、混合推理(System 1.x)以及复杂决策(System 2)。此外,该套件还包括三个训练数据集,为持续预训练(CPT)、监督微调(SFT)以及基于可验证奖励的强化学习(RLVR)提供基础设施。借助该套件,我们开发了Morpheus,即首个针对麻醉推理的基线模型集合。尽管经过有限的SFT和分组相对策略优化(GRPO)训练,Morpheus不仅在麻醉领域实现了显著的性能提升,甚至与更大规模模型的表现相媳美,且在一般医学及广泛领域基准测试中也展现出增强的推理能力。进一步通过全面评估和实验,我们分析了影响麻醉推理性能的关键因素,包括模型特征、训练策略和训练数据。AnesSuite和Morpheus将在https://github.com/MiliLab/AnesSuite发布。
引用
@article{arxiv.2504.02404,
title = {AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs},
author = {Xiang Feng and Wentao Jiang and Zengmao Wang and Yong Luo and Pingbo Xu and Baosheng Yu and Hua Jin and Jing Zhang},
journal= {arXiv preprint arXiv:2504.02404},
year = {2026}
}
备注
Accepted in ICLR 2026; 47 pages, 12 figures, 26 tables;