AttributionBench:自动归因评估有多难?
计算与语言
2024-02-26 v1 人工智能
机器学习
摘要
现代生成式搜索引擎通过提供引证证据来增强大语言模型(LLM)响应的可靠性。然而,评估答案的归因——即生成响应中的每个声明是否完全由其引证证据支持——仍然是一个未解决的问题。这种验证传统上依赖于昂贵的人工评估,凸显了对自动归因评估方法的迫切需求。为了弥补这些方法缺乏标准化基准的空白,我们提出了AttributionBench,一个从多个现有归因数据集中整理的综合基准。我们在AttributionBench上的大量实验揭示了自动归因评估的挑战,即使对于最先进的LLM也是如此。具体来说,我们的发现表明,即使在二分类公式下,微调后的GPT-3.5也只能达到约80%的宏F1值。对超过300个错误案例的详细分析表明,大多数失败源于模型处理细微信息的能力不足,以及模型可访问信息与人工标注者所掌握信息之间的差异。
引用
@article{arxiv.2402.15089,
title = {AttributionBench: How Hard is Automatic Attribution Evaluation?},
author = {Yifei Li and Xiang Yue and Zeyi Liao and Huan Sun},
journal= {arXiv preprint arXiv:2402.15089},
year = {2024}
}