ClashEval: 量化大语言模型内部先验与外部证据之间的拉锯战
计算与语言
2025-02-10 v3 人工智能
摘要
检索增强生成(RAG)常用于减轻大语言模型(LLM)的幻觉并提供最新知识。然而,由于文档检索是一项不精确的任务,有时会在上下文中呈现错误甚至有害的内容,这引发了一个问题:LLM如何处理检索到的信息?如果提供的内容不正确,模型是否知道忽略它,还是会重复该错误?相反,当模型的初始响应错误时,它是否总是知道利用检索到的信息来纠正自己,还是坚持其错误的先验响应?为了回答这些问题,我们整理了一个包含六个领域(例如药物剂量、奥运纪录、地点)超过1200个问题的数据集,以及回答每个问题相关的上下文内容。我们进一步对内容中的答案施加了从细微到明显的精确扰动。我们在此数据集上对包括GPT-4o在内的六个顶级LLM进行了基准测试,发现LLM容易采纳错误的检索内容,在超过60%的情况下覆盖其自身正确的先验知识。然而,检索内容越不现实(即偏离真相越多),模型采纳它的可能性就越小。此外,模型对其初始响应越不自信(通过测量token概率),就越可能采纳检索内容中的信息。我们利用这一发现,展示了在存在冲突检索内容时提高模型准确性的简单方法。我们的结果突出了一个对LLM来说困难的任务和基准——即,在面对正确检索内容时正确判断自身何时错误,并在提供的内容不正确时拒绝采纳的能力。
引用
@article{arxiv.2404.10198,
title = {ClashEval: Quantifying the tug-of-war between an LLM's internal prior and external evidence},
author = {Kevin Wu and Eric Wu and James Zou},
journal= {arXiv preprint arXiv:2404.10198},
year = {2025}
}
备注
Revised June 9 2024