中文

利用领域特定检索增强生成增强大型语言模型:眼科长文本消费者健康问答案例研究

计算与语言 2024-09-24 v1 人工智能

摘要

尽管大型语言模型(LLM)在医学领域具有潜力,但其生成的回答可能缺乏支持证据或基于幻觉证据。虽然检索增强生成(RAG)常被用于解决此问题,但很少有研究在下游领域特定应用中实现并评估 RAG。我们开发了一个包含 70,000 篇眼科特定文档的 RAG 流水线,在推理时检索相关文档以增强 LLM。在一项关于长文本消费者健康问题的案例研究中,我们由 10 位医疗专业人员对 100 个问题进行了系统性评估,包括 LLM 在有无 RAG 情况下提供的 500 多条参考文献。评估重点包括证据的事实性、证据的选择与排序、证据的归因,以及回答的准确性与完整性。未使用 RAG 的 LLM 共提供了 252 条参考文献。其中,45.3% 为幻觉,34.1% 存在轻微错误,20.6% 正确。相比之下,使用 RAG 的 LLM 显著提高了准确性(54.5% 正确)并降低了错误率(18.8% 存在轻微幻觉,26.7% 存在错误)。RAG 检索出的前 10 篇文档中有 62.5% 被选为 LLM 回答的首选参考文献,平均排名为 4.9。使用 RAG 还改善了证据归因(在 5 分制上从 1.85 提高到 2.49,P<0.001),尽管准确性与完整性略有下降(分别从 3.52 降至 3.23,P=0.03;从 3.47 降至 3.27,P=0.17)。结果表明,LLM 在回答中经常表现出幻觉和错误证据,引发了对医学领域下游应用的担忧。RAG 大幅减少了此类证据的比例,但仍面临挑战。

关键词

引用

@article{arxiv.2409.13902,
  title  = {Enhancing Large Language Models with Domain-specific Retrieval Augment Generation: A Case Study on Long-form Consumer Health Question Answering in Ophthalmology},
  author = {Aidan Gilson and Xuguang Ai and Thilaka Arunachalam and Ziyou Chen and Ki Xiong Cheong and Amisha Dave and Cameron Duic and Mercy Kibe and Annette Kaminaka and Minali Prasad and Fares Siddig and Maxwell Singer and Wendy Wong and Qiao Jin and Tiarnan D. L. Keenan and Xia Hu and Emily Y. Chew and Zhiyong Lu and Hua Xu and Ron A. Adelman and Yih-Chung Tham and Qingyu Chen},
  journal= {arXiv preprint arXiv:2409.13902},
  year   = {2024}
}