中文

洞察大语言模型不确定性与校准:基于专科临床问答的基准测试

计算与语言 2026-01-27 v3

摘要

可靠的不确定性量化(UQ)对于在高风险领域如临床问答(QA)中应用大语言模型(LLM)至关重要。本文聚焦评估临床 QA 场景下的不确定性估计方法,首次关注十一个临床专科和六种问题类型,以及十个开源 LLM(通用、生物医学和推理模型),并包含代表性的专有模型。我们分析基于得分的 UQ 方法,提出一种基于推理导数行为特征的轻量级新方法,并检视作为补充集合方法的保守预测。我们的发现表明,不确定性可靠性并非单一属性,而是取决于临床专科和问题类型,因为校准和区分度会发生变化。我们的结果凸显了根据其独特且互补优势选择或组合模型以满足临床需求的必要性。

关键词

引用

@article{arxiv.2506.10769,
  title  = {Mind the Gap: Benchmarking LLM Uncertainty and Calibration with Specialty-Aware Clinical QA and Reasoning-Based Behavioural Features},
  author = {Alberto Testoni and Iacer Calixto},
  journal= {arXiv preprint arXiv:2506.10769},
  year   = {2026}
}

备注

Accepted at EACL 2026 (Main Conference)