大语言模型在生物医学问答中对错误信息的鲁棒性
计算与语言
2024-10-30 v1 人工智能
摘要
检索增强生成(RAG)方法通过检索并提供来自外部知识源的额外上下文(例如,将上下文添加到提示中),用于减少大语言模型(LLM)在问答中的虚构现象。然而,注入错误信息可能会误导LLM生成错误答案。在本文中,我们评估了四种LLM——Gemma 2、GPT-4o-mini、Llama 3.1和Mixtral——在回答生物医学问题时对错误信息的有效性和鲁棒性。我们在三种场景下评估了是非题和自由形式问题的答案准确性:原始LLM回答(不提供上下文)、“完美”增强生成(提供正确上下文)和提示注入攻击(提供错误上下文)。我们的结果显示,Llama 3.1(700亿参数)在原始(0.651)和“完美”RAG(0.802)场景中均达到了最高的准确率。然而,在“完美”RAG下,模型间的准确率差距几乎消失,这表明其有潜力缩小因LLM规模引起的有效性差异。我们进一步评估了LLM一方面生成恶意上下文的能力,另一方面LLM对提示注入攻击的鲁棒性,使用了攻击成功率(ASR)、受攻击时的准确率和准确率下降等指标。作为攻击方,我们使用相同的四个LLM(Gemma 4、GPT-4o-mini、Llama 3.1和Mixtral)来生成错误上下文,并将其注入目标模型的提示中。有趣的是,Llama被证明是最有效的攻击者,导致目标模型的原始回答准确率下降高达0.48,“完美”RAG准确率下降高达0.63。我们的分析揭示,鲁棒性排名因评估指标而异,这凸显了评估LLM抵御对抗攻击韧性的复杂性。
引用
@article{arxiv.2410.21330,
title = {LLM Robustness Against Misinformation in Biomedical Question Answering},
author = {Alexander Bondarenko and Adrian Viehweger},
journal= {arXiv preprint arXiv:2410.21330},
year = {2024}
}