ClinDet-Bench:超越回避,评估 LLM 在临床决策中的判断可行性
人工智能
2026-02-27 v1 数据库
摘要
临床决策常需在信息不完整的情况下进行。临床专家必须识别可用信息是否足以做出判断,因为过早的结论和不必要的回避都可能危及患者安全。为评估大型语言模型(LLM)的此类能力,我们开发了 ClinDet-Bench,这是一个基于临床评分系统的基准测试,将信息不完整的场景分解为可判定与不可判定条件。识别可判定性需要考虑所有关于缺失信息的假设,包括不太可能的假设,并验证结论在这些假设下是否成立。我们发现,近期的 LLM 在信息不完整时无法识别可判定性,既会产生过早判断,也会产生过度回避,尽管它们在正确解释底层评分知识方面表现良好,且在信息完整时表现出色。这表明现有的基准测试不足以评估 LLM 在临床环境中的安全性。ClinDet-Bench 提供了用于评估可判定性识别、实现恰当回避的框架,潜在可适用于医学及其他高风险领域,已公开提供。
引用
@article{arxiv.2602.22771,
title = {ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making},
author = {Yusuke Watanabe and Yohei Kobashi and Takeshi Kojima and Yusuke Iwasawa and Yasushi Okuno and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2602.22771},
year = {2026}
}
备注
17 pages, 3 figures, 10 tables