通过在动态牙科临床场景中评估LLMs来弥合知识-行动鸿沟
计算与语言
2026-01-21 v1
摘要
大型语言模型(LLMs)从被动的知识检索器向自主临床智能体的转变,要求评估方式发生转变——从静态准确性转向动态行为可靠性。为了在牙科领域探索这一边界(在该领域,高质量的AI建议独特地赋能了患者参与式决策),我们提出了标准化临床管理与性能评估(SCMPE)基准,该基准全面评估了从面向知识的评估(静态客观任务)到基于工作流的模拟(多轮模拟患者交互)的性能。我们的分析表明,尽管模型在静态客观任务中表现出很高的熟练度,但它们在动态临床对话中的性能急剧下降,这表明主要瓶颈不在于知识保留,而在于主动信息收集和动态状态跟踪的关键挑战。将“指南依从性”与“决策质量”进行映射,揭示了通用模型中普遍存在的“高效力、低安全性”风险。此外,我们量化了检索增强生成(RAG)的影响。虽然RAG减轻了静态任务中的幻觉,但其在动态工作流中的效果有限且异质的,有时甚至导致性能下降。这表明,如果没有领域自适应预训练,仅靠外部知识无法弥合推理鸿沟。本研究实证描绘了牙科LLMs的能力边界,为弥合标准化知识与安全、自主临床实践之间的鸿沟提供了路线图。
引用
@article{arxiv.2601.12974,
title = {Bridging the Knowledge-Action Gap by Evaluating LLMs in Dynamic Dental Clinical Scenarios},
author = {Hongyang Ma and Tiantian Gu and Huaiyuan Sun and Huilin Zhu and Yongxin Wang and Jie Li and Wubin Sun and Zeliang Lian and Yinghong Zhou and Yi Gao and Shirui Wang and Zhihui Tang},
journal= {arXiv preprint arXiv:2601.12974},
year = {2026}
}
备注
29 pages, 15 figures