ConQRet:基于 LLM 评判器对检索增强论证进行细粒度基准测试
计算与语言
2024-12-09 v1 人工智能
信息检索
摘要
计算论证涉及为争议话题(如堕胎禁令和疫苗)生成答案或摘要,在当今高度对立的环境中变得越来越重要。高级 LLM 能力通过检索增强论证(RAArg)提供了为此类问题提供基于证据、细致答案的潜力,利用真实世界证据生成高质量、扎实的论证。然而,评估 RAArg 仍然具有挑战性,因为人工评估成本高昂且难以处理复杂、冗长的答案。同时,重用现有论证数据集已不足以进行全面评估,因为它们缺乏长篇复杂论证和来自可能误导来源的真实证据,限制了对检索效果和论证质量的整体评估。为此,我们研究使用多个细粒度 LLM 评判器进行自动评估,提供比传统单一评分指标甚至之前人工众包更好的、更可解释的评估。为验证所提方法,我们引入 ConQRet,一个包含论 debated 话题上长篇复杂人类撰写论证的数据集,基于真实网站,涵盖检索效果、论证质量和扎实性等方面的彻底评估。我们在先前数据集和新的 ConQRet 基准上验证了 LLM 评判器。我们提出的 LLM 评判器和 ConQRet 基准可以促进计算论证的快速进展,并可自然扩展到其他复杂检索增强生成任务。
关键词
引用
@article{arxiv.2412.05206,
title = {ConQRet: Benchmarking Fine-Grained Evaluation of Retrieval Augmented Argumentation with LLM Judges},
author = {Kaustubh D. Dhole and Kai Shu and Eugene Agichtein},
journal= {arXiv preprint arXiv:2412.05206},
year = {2024}
}