检索增强长文本生成中的依据性:一项实证研究
计算与语言
2024-04-11 v1 机器学习
摘要
我们提出了一项关于通过检索增强大型语言模型(LLM)进行长文本问答(LFQA)中依据性的实证研究。具体而言,我们评估了每个生成的句子是否基于检索到的文档或模型的预训练数据。在 3 个数据集和 4 个模型族中,我们的研究结果表明,很大一部分生成的句子始终缺乏依据,即使这些句子包含正确的标准答案。此外,我们考察了模型大小、解码策略和指令微调等因素对依据性的影响。我们的结果表明,虽然较大的模型倾向于更有效地使其输出有据可依,但相当一部分正确答案仍因幻觉而受损。本研究提供了对 LFQA 中依据性挑战的新见解,并强调了 LLM 需要更稳健的机制来缓解无依据内容的生成。
引用
@article{arxiv.2404.07060,
title = {Groundedness in Retrieval-augmented Long-form Generation: An Empirical Study},
author = {Alessandro Stolfo},
journal= {arXiv preprint arXiv:2404.07060},
year = {2024}
}
备注
NAACL 2024 (Findings)