HALO:幻觉分析与学习优化——赋能大语言模型检索增强上下文以指导临床决策
计算与语言
2024-09-20 v2 人工智能
摘要
大语言模型(LLMs)显著推进了自然语言处理任务,但它们容易生成不准确或不可靠的响应,这种现象被称为幻觉。在健康和医学等关键领域,这些幻觉可能带来严重风险。本文介绍了HALO,这是一个新颖的框架,旨在通过专注于检测和缓解幻觉来提高医学问答(QA)系统的准确性和可靠性。我们的方法使用LLMs生成给定查询的多个变体,并从外部开放知识库中检索相关信息以丰富上下文。我们利用最大边际相关性评分对检索到的上下文进行优先级排序,然后将其提供给LLMs用于答案生成,从而降低幻觉风险。LangChain的集成进一步简化了这一过程,显著且稳健地提高了开源和商业LLMs(如Llama-3.1(从44%到65%)和ChatGPT(从56%到70%))的准确性。该框架强调了在医学问答系统中解决幻觉问题的关键重要性,最终改善了临床决策和患者护理。开源HALO可在以下网址获取:https://github.com/ResponsibleAILab/HALO。
引用
@article{arxiv.2409.10011,
title = {HALO: Hallucination Analysis and Learning Optimization to Empower LLMs with Retrieval-Augmented Context for Guided Clinical Decision Making},
author = {Sumera Anjum and Hanzhi Zhang and Wenjun Zhou and Eun Jin Paek and Xiaopeng Zhao and Yunhe Feng},
journal= {arXiv preprint arXiv:2409.10011},
year = {2024}
}
备注
10 pages, 4 figures