大型语言模型的长文本事实性
摘要
大型语言模型(LLM)在回答关于开放主题的事实寻求型提示时,生成的内容经常包含事实错误。为了在开放领域对模型的长文本事实性进行基准测试,我们首先使用 GPT-4 生成了 LongFact,这是一个包含跨越 38 个主题的数千个问题的提示集。然后我们提出,可以通过一种我们称为搜索增强事实性评估器(SAFE)的方法,将 LLM 智能体用作长文本事实性的自动化评估器。SAFE 利用 LLM 将长文本响应分解为一系列独立事实,并通过包含向 Google Search 发送搜索查询并判断某个事实是否得到搜索结果支持的多步推理过程来评估每个事实的准确性。此外,我们提出将 F1 分数扩展为长文本事实性的聚合指标。为此,我们平衡了响应中受支持事实的百分比(精确率)与所提供事实相对于代表用户偏好响应长度的超参数的百分比(召回率)。根据经验,我们证明 LLM 智能体可以超越众包人工标注员——在约 1.6 万个独立事实的集合上,SAFE 与众包人工标注员有 72% 的时间保持一致;在 100 个分歧案例的随机子集上,SAFE 有 76% 的时间获胜。同时,SAFE 的成本比人工标注员低 20 倍以上。我们还在四个模型系列(Gemini、GPT、Claude 和 PaLM-2)中对 LongFact 上的十三个语言模型进行了基准测试,发现较大的语言模型通常能取得更好的长文本事实性。LongFact、SAFE 和所有实验代码可在 https://github.com/google-deepmind/long-form-factuality 获取。
引用
@article{arxiv.2403.18802,
title = {Long-form factuality in large language models},
author = {Jerry Wei and Chengrun Yang and Xinying Song and Yifeng Lu and Nathan Hu and Jie Huang and Dustin Tran and Daiyi Peng and Ruibo Liu and Da Huang and Cosmo Du and Quoc V. Le},
journal= {arXiv preprint arXiv:2403.18802},
year = {2024}
}
备注
NeurIPS 2024; 72 pages, 18 figures, 30 tables. Code at https://github.com/google-deepmind/long-form-factuality