中文

理解检索增强生成在医疗领域中的置信度影响:案例研究

计算与语言 2025-08-20 v3

摘要

检索增强生成(RAG)通过利用外部信息来增强大型语言模型(LLM)的响应准确性,从而补充其知识,这一方法在多个领域广泛应用,旨在注入最新信息以释放 RAG 在高风险应用中的潜能。然而,尽管 RAG 有望满足这些需求,但其输出置信度的机制仍未得到充分探索。我们的研究聚焦于 RAG,特别是检查 RAG 是否提高了医疗领域 LLM 输出的置信度。我们在各种配置和模型下进行了分析。我们通过将模型预测的概率视为其输出,并计算包括校准误差方法、熵、最佳概率和准确率等多个评估指标来评估置信度。实验结果表明,某些模型具有判断所插入文档是否与正确答案相关的能力。这些结果表明,基于其输出概率对模型的评估可确定其在 RAG 框架中是否作为生成器发挥作用。我们的ethods 允许我们评估模型是否处理检索到的文档。

关键词

引用

@article{arxiv.2412.20309,
  title  = {Understanding the Impact of Confidence in Retrieval Augmented Generation: A Case Study in the Medical Domain},
  author = {Shintaro Ozaki and Yuta Kato and Siyuan Feng and Masayo Tomita and Kazuki Hayashi and Wataru Hashimoto and Ryoma Obara and Masafumi Oyamada and Katsuhiko Hayashi and Hidetaka Kamigaito and Taro Watanabe},
  journal= {arXiv preprint arXiv:2412.20309},
  year   = {2025}
}

备注

Accepted to BioNLP2025 (Workshop colocated with ACL2025)