UniSumEval:面向 LLM 的统一、细粒度、多维度摘要评估
计算与语言
2024-10-02 v2 人工智能
摘要
现有的摘要质量评估基准往往缺乏多样化的输入情景、聚焦于狭窄定义的维度(如忠实性),并在主观且粗粒度的标注方案上感到困难。为此,我们创建了 UniSumEval 基准,扩展了输入上下文范围(如领域、长度),并提供细粒度、多维度的标注。我们利用 AI 辅助数据创建,识别可能产生幻觉的输入文本,并帮助人类标注者降低细粒度标注任务的难度。有了 UniSumEval,我们对九个最新的语言模型作为摘要生成器进行基准测试,洞察它们在不同输入情境和评估维度上的表现。进一步,我们对 SOTA 自动摘要评估器进行了彻底比较。本基准数据将在 https://github.com/DISL-Lab/UniSumEval-v1.0 上提供。
引用
@article{arxiv.2409.19898,
title = {UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs},
author = {Yuho Lee and Taewon Yun and Jason Cai and Hang Su and Hwanjun Song},
journal= {arXiv preprint arXiv:2409.19898},
year = {2024}
}
备注
Accepted at EMNLP-Findings 2024