中文

大型语言模型在医学问答中的不确定性估计

计算与语言 2024-07-12 v1 人工智能

摘要

大型语言模型 (LLM) 在医疗领域的自然语言生成方面显示出广泛前景,但存在虚构事实错误信息的风险。将 LLM 部署用于医学问答 necessitates 依赖可靠的不确定性估计 (UE) 方法来检测幻觉现象。本文对流行的 UE 方法在不同模型规模上的医学问答数据集上进行基准测试。我们的结果表明,当前方法在该领域 generally 表现不佳,这凸显了医学应用中 UE 的挑战。我们还观察到,较大的模型倾向于获得更好的结果,暗示模型规模与 UE 可靠性之间存在相关性。为应对这些挑战,我们提出了一种基于概率的不确定性估计方法——双相验证 (Two-phase Verification)。首先,LLM 生成初始答案时会生成逐步解释,然后提出验证问题以检查解释中的事实陈述。该模型随后以两次方式回答这些问题:一次独立回答,一次参考解释。两套答案之间的不一致性用于衡量原始响应的不确定性。我们使用 Llama 2 Chat 模型在三个生物医学问答数据集上评估了我们的方法,并将其与基准方法进行比较。结果表明,我们的双相验证方法在各种数据集和模型规模下实现了最佳整体准确率和稳定性,其性能随模型规模的增大而提升。

关键词

引用

@article{arxiv.2407.08662,
  title  = {Uncertainty Estimation of Large Language Models in Medical Question Answering},
  author = {Jiaxin Wu and Yizhou Yu and Hong-Yu Zhou},
  journal= {arXiv preprint arXiv:2407.08662},
  year   = {2024}
}