中文

利用非典型表现重校准增强医疗 LLM 的可信度

计算与语言 2024-09-06 v1

摘要

黑盒大型语言模型(LLM)越来越多地部署于各种环境中,这使得这些模型必须有效地表达其置信度与不确定性,尤其是在高风险场景下。然而,这些模型通常表现出过度自信,从而导致潜在风险与误判。现有用于引导和校准 LLM 置信度的技术主要集中于通用推理数据集,仅取得了有限的改进。准确的校准对于知情决策和防止不良后果至关重要,但由于这些模型所执行任务的复杂性和多变性,这仍然具有挑战性。在本研究中,我们探讨了医疗场景下黑盒 LLM 的失校准行为。我们提出了一种名为“非典型表现重校准”的新方法,该方法利用非典型表现来调整模型的置信度估计。我们的方法显著改善了校准效果,在三个医学问答数据集上将校准误差降低了约 60%,并优于现有方法,如原始语言化置信度、CoT 语言化置信度等。此外,我们对非典型性在校准框架中的作用进行了深入分析。

关键词

引用

@article{arxiv.2409.03225,
  title  = {Enhancing Healthcare LLM Trust with Atypical Presentations Recalibration},
  author = {Jeremy Qin and Bang Liu and Quoc Dinh Nguyen},
  journal= {arXiv preprint arXiv:2409.03225},
  year   = {2024}
}