用于评估大型语言模型长篇文本生成的 ProxyQA 框架
计算与语言
2024-06-05 v4 人工智能
摘要
大型语言模型(LLMs)在理解长篇内容方面取得了显著进展。然而,探索其生成长篇内容(如报告和文章)的能力相对未被充分探索和不充分评估。现有的评估方法主要依赖众包,因其 labor-intensive 且效率不高;而自动化指标如 ROUGE 得分与人类判断标准呈现不一致。本文提出 ProxyQA,一种创新的长文本生成评估框架。ProxyQA 包含多个领域的深入人工精选元问题,每个问题都伴随特定的 proxy 题目并预先标注了答案。LLMs 需要针对这些元问题生成大量内容,同时邀请评估者并将生成的文本作为背景信息。ProxyQA 通过评估者解决 proxy 题目的准确性来评估生成内容的质量。我们检验了多个 LLMs,强调 ProxyQA 作为高质量评估工具的严苛性。人类评估表明,proxy 题目方法在自我一致性方面具有显著优势,并与人类评估标准高度一致。该数据集和排行榜可在 \url{https://proxy-qa.com} 上访问。
引用
@article{arxiv.2401.15042,
title = {PROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models},
author = {Haochen Tan and Zhijiang Guo and Zhan Shi and Lu Xu and Zhili Liu and Yunlong Feng and Xiaoguang Li and Yasheng Wang and Lifeng Shang and Qun Liu and Linqi Song},
journal= {arXiv preprint arXiv:2401.15042},
year = {2024}
}
备注
Accepted to ACL 2024 main conference