CiteEval:面向来源归因的原则驱动引用评估
计算与语言
2025-06-03 v1 人工智能
信息检索
摘要
引用质量在信息检索系统中至关重要,直接影响信任度和信息获取的有效性。当前的评估框架,无论是人工还是自动的,主要依赖自然语言推理(NLI)来评估引用来源的二元或三元支持性,我们认为这是引用评估的一个次优代理。在本工作中,我们引入了 CiteEval,一个由原则驱动的引用评估框架,专注于广泛上下文中的细粒度引用评估,不仅涵盖被引来源,还包括完整的检索上下文、用户查询和生成的文本。在所提框架的指导下,我们构建了 CiteBench,一个在引用质量上具有高质量人工标注的多领域基准。为实现高效评估,我们进一步开发了 CiteEval-Auto,一套基于模型的指标,与人类判断表现出很强的相关性。在多样化系统上的实验表明,与现有指标相比,CiteEval-Auto 在捕捉引用的多面性方面具有卓越能力,为评估和改进模型生成的引用提供了一种有原则且可扩展的方法。
引用
@article{arxiv.2506.01829,
title = {CiteEval: Principle-Driven Citation Evaluation for Source Attribution},
author = {Yumo Xu and Peng Qi and Jifan Chen and Kunlun Liu and Rujun Han and Lan Liu and Bonan Min and Vittorio Castelli and Arshit Gupta and Zhiguo Wang},
journal= {arXiv preprint arXiv:2506.01829},
year = {2025}
}
备注
ACL 2025