长形式问答评估的实证研究
信息检索
2025-04-28 v1
摘要
长形式问答(LFQA)旨在生成对复杂问题的详细答案。该场景既提供了很大的灵活性,也带来了显著的评估挑战。大多数评估依赖于基于字符串或n-gram匹配的确定性指标,而大型语言模型用于长形式答案评估的可靠性尚未得到广泛探讨。我们通过开展深入的长形式答案评估研究,回答以下研究问题:(i)现有自动评估指标在多大程度上可以替代人工评估?(ii)现有评估指标相对于人工评估存在哪些局限性?(iii)如何提高现有评估方法的有效性和鲁棒性?我们收集了5,236个由不同大型语言模型生成的事实性和非事实性长形式答案,并对其中2,079个答案进行人工评估,关注正确性和信息丰富性。随后,我们通过对这些答案进行自动评估,分析了这些指标与人工评估之间的一致性。我们发现,答案的风格、长度以及问题类别都会偏向自动评估指标。然而,采用细粒度评估有助于缓解某些指标的此类问题。我们的发现对大型语言模型用于长形式问答评估具有重要意义。所有代码和数据集均可在 https://github.com/bugtig6351/lfqa_evaluation 获取。
引用
@article{arxiv.2504.18413,
title = {An Empirical Study of Evaluating Long-form Question Answering},
author = {Ning Xian and Yixing Fan and Ruqing Zhang and Maarten de Rijke and Jiafeng Guo},
journal= {arXiv preprint arXiv:2504.18413},
year = {2025}
}