临床大语言模型中安全性与准确性遵循不同的缩放规律
计算与语言
2026-05-06 v1 人工智能
机器学习
摘要
临床 LLM 通常通过增加模型规模、上下文长度、检索复杂度或推理时计算来进行缩放,其隐含期望是更高的准确性意味着更安全的行为。这一假设在医学领域是不完整的,因为少数自信、高风险或与证据相悖的错误可能比平均基准测试表现更重要。我们引入了 SaFE-Scale,一个用于测量临床 LLM 安全性如何随模型规模、证据质量、检索策略、上下文暴露和推理时计算变化的框架。为了实例化该框架,我们引入了 RadSaFE-200,一个包含 200 道多选题的放射学安全评估基准,具有临床医生定义的清洁证据、冲突证据,以及针对高风险错误、不安全答案和证据矛盾选项级别的标签。我们在六种部署条件下评估了 34 个本地部署的 LLM:闭卷提示(零样本)、清洁证据、冲突证据、标准 RAG、智能体 RAG 和最大上下文提示。清洁证据带来了最显著的改善,将平均准确率从 73.5% 提高到 94.1%,同时将高风险错误从 12.0% 降至 2.6%,矛盾从 12.7% 降至 2.3%,危险过度自信从 8.0% 降至 1.6%。标准 RAG 和智能体 RAG 未能重现这一安全特征:智能体 RAG 比标准 RAG 提高了准确率并减少了矛盾,但高风险错误和危险过度自信仍然处于较高水平。最大上下文提示增加了延迟但未能弥合安全差距,而额外的推理时计算仅带来有限的收益。最坏情况分析表明,具有临床后果的错误集中在少数问题子集中。因此,临床 LLM 的安全性并非缩放的被动结果,而是由证据质量、检索设计、上下文构建和集体失败行为塑造的部署属性。
引用
@article{arxiv.2605.04039,
title = {Safety and accuracy follow different scaling laws in clinical large language models},
author = {Sebastian Wind and Tri-Thien Nguyen and Jeta Sopa and Mahshad Lotfinia and Sebastian Bickelhaup and Michael Uder and Harald Köstler and Gerhard Wellein and Sven Nebelung and Daniel Truhn and Andreas Maier and Soroosh Tayebi Arasteh},
journal= {arXiv preprint arXiv:2605.04039},
year = {2026}
}