证据支撑的亚特秘诀推理:评估基于 2025 年内分泌科考试的临床智能层
人工智能
2026-02-19 v1 计算与语言
摘要
背景:大型语言模型在一般医学考试中表现出强大的性能,但亚特秘诀临床推理仍具有挑战性 due to 指南不断演变和 evidence 层级的细微差异。方法:我们在 2025 年内分泌科考试风格的 120 题考试中评估了 Mirror,这是一个基于证据的临床推理系统,与前沿 LLM(GPT-5、GPT-5.2、Gemini-3-Pro)进行比较。Mirror 将整合了内分泌科和心血管代谢 evidence 语料库的结构化推理架构,用于生成基于证据的输出。Mirror 在无外部检索的封闭证据约束下运行。比较型 LLM 具有实时 web 访问权限,可获取指南和原始文献。结果:Mirror 实现了 87.5% 的准确率(105/120;95% 置信区间:80.4-92.3%),超过了人类参考答案的 62.3%,以及包括 GPT-5.2(74.6%)、GPT-5(74.0%)和 Gemini-3-Pro(69.8%)在内的前沿 LLM。在最难的 30 个问题(人类准确率低于 50%)上,Mirror 实现了 76.7% 的准确率。Top-2 准确率为 Mirror 达到 92.5%,而 GPT-5.2 为 85.25%。结论:Mirror 提供了证据可追溯性:74.2% 的输出至少引用了一个指南层级来源,100% 的引用在手动验证中均准确。精选证据配以显式来源可超越不受约束的 web 检索实现亚特秘诀临床推理,并支持临床部署的可审计性。
引用
@article{arxiv.2602.16050,
title = {Evidence-Grounded Subspecialty Reasoning: Evaluating a Curated Clinical Intelligence Layer on the 2025 Endocrinology Board-Style Examination},
author = {Amir Hosseinian and MohammadReza Zare Shahneh and Umer Mansoor and Gilbert Szeto and Kirill Karlin and Nima Aghaeepour},
journal= {arXiv preprint arXiv:2602.16050},
year = {2026}
}