QUILL:大型语言模型的引文生成增强
计算与语言
2025-02-21 v2 人工智能
摘要
尽管大型语言模型(LLMs)已成为优秀的写作助手,但它们在引文生成方面仍然存在困难。这是因为它们在提供事实性引文时要么产生幻觉,要么无法提供超出人类预期的引文。为弥合这一差距,我们系统地研究了如何评估和改进 LLMs 在引文生成任务中的表现。我们首先建立了一个全面且自动化的引文生成评估体系,该体系包含五项标准,每项标准均有对应的自动指标。为提升 LLMs 的引文生成能力,我们构建了一个范围广泛、维度丰富的双语知识库,包含多达 32,022 条引文。此外,在我们的标准指导下,我们进一步设计了一种专门针对引文的指标,用于对从知识库中检索到的引文进行重排序。大量实验表明,我们的指标与人类偏好高度相关。现有的 LLMs 难以生成理想的引文,但我们的引文知识库和重排序指标有助于缩小这一差距。我们的数据集和代码已公开发布,地址为 https://github.com/GraceXiaoo/QUILL。
引用
@article{arxiv.2411.03675,
title = {QUILL: Quotation Generation Enhancement of Large Language Models},
author = {Jin Xiao and Bowei Zhang and Qianyu He and Jiaqing Liang and Feng Wei and Jinglei Chen and Zujie Liang and Deqing Yang and Yanghua Xiao},
journal= {arXiv preprint arXiv:2411.03675},
year = {2025}
}
备注
17 pages, 6 figures