LongCite:使 LLMs 在长上下文问答中生成细粒度引用
计算与语言
2024-09-11 v3
摘要
尽管当前的长上下文大语言模型(LLMs)在基于大量文本回答用户问题方面展示了令人印象深刻的能力,但其回答中缺乏引用使得用户难以验证,并因其潜在的幻觉引发了对可信度的担忧。在这项工作中,我们旨在使长上下文 LLMs 能够生成带有细粒度句子级引用的回答,从而提高其忠实度与可验证性。我们首先引入了 LongBench-Cite,这是一个用于评估当前 LLMs 在带引用的长上下文问答(LQAC)中表现的自动化基准,揭示了相当大的改进空间。为此,我们提出了 CoF(Coarse to Fine),一种利用现成 LLMs 自动生成带有精确句子级引用的长上下文问答实例的新颖流程,并利用该流程构建了 LongCite-45k,一个用于 LQAC 的大规模 SFT 数据集。最后,我们使用 LongCite-45k 数据集训练了 LongCite-8B 和 LongCite-9B,成功使它们能够在单次输出中生成准确的回答和细粒度句子级引用。在 LongBench-Cite 上的评估结果表明,我们训练的模型实现了最先进的引用质量,超越了包括 GPT-4o 在内的先进专有模型。
引用
@article{arxiv.2409.02897,
title = {LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA},
author = {Jiajie Zhang and Yushi Bai and Xin Lv and Wanjun Gu and Danqing Liu and Minhao Zou and Shulin Cao and Lei Hou and Yuxiao Dong and Ling Feng and Juanzi Li},
journal= {arXiv preprint arXiv:2409.02897},
year = {2024}
}