GlobalDentBench:面向LLM临床牙科推理的跨国基准测试
人工智能
2026-05-27 v2 计算与语言
摘要
尽管大语言模型(LLM)在医学领域具有变革性潜力,但其在真实临床场景中的推理鲁健性和安全性仍受到严重不足的关注,尤其是在牙科领域。本文介绍GlobalDentBench,首个跨国牙科基准,包含涵盖88个国家和地区(横跨六大洲)的14个牙科专科的分类学。该基准包含8,978个经专家验证的问题,涉及三种格式(多选题、简答题和案例题),并评估三个逐步推理层次:知识记忆(L1)、常规推理(L2)和个性化推理(L3)。为确保数据质量,该自动构建框架经六位资深牙科医生校准,多选题和简答题的专家一致率达99.98%,更复杂的案例题为96.78%。对12个前沿LLM在GlobalDentBench上的评估显示,随着推理复杂度的增加,性能呈现明显的阶梯式下降。具体而言,多选题准确率从81.34%急剧下降至64.53%(简答题)和22.34%(案例题),而在L1到L2到L3的准确率分别从74.01%、55.64%和35.71%显著下降。更关键的是,对真实牙科病例的风险分析显示,LLM生成的临床建议总体不安全率达31.01%,其中4.51%的风险可能导致不可逆的患者伤害,风险在正畸学等专科尤为突出。这些发现揭示了当前LLM在医学推理和安全性方面的根本性局限。因此,GlobalDentBench为可信的临床AI评估提供了可扩展的基础,凸显了在医疗保健领域安全部署这些模型前需进行严格验证的紧迫性。
引用
@article{arxiv.2605.24636,
title = {GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration},
author = {Junjie Zhao and Jingyi Liang and Zhenyang Cai and Jiaming Zhang and Zhenwei Wen and Shuzhi Deng and Wenjing Yi and Chunfeng Luo and Hexian Zhang and Junying Chen and Tianrui Liu and Zhuhui Bai and Zixu Zhang and Pradeep Singh and Xiang Liu and Jianquan Li and Nhan L Tran and Falk Schwendicke and Zuolin Jin and Lijian Jin and Liangyi Chen and Wei-fa Yang and Benyou Wang and Junwen Wang and Shan Jiang},
journal= {arXiv preprint arXiv:2605.24636},
year = {2026}
}