中文

UniSumEval:面向 LLM 的统一、细粒度、多维度摘要评估

计算与语言 2024-10-02 v2 人工智能

摘要

现有的摘要质量评估基准往往缺乏多样化的输入情景、聚焦于狭窄定义的维度(如忠实性),并在主观且粗粒度的标注方案上感到困难。为此,我们创建了 UniSumEval 基准,扩展了输入上下文范围(如领域、长度),并提供细粒度、多维度的标注。我们利用 AI 辅助数据创建,识别可能产生幻觉的输入文本,并帮助人类标注者降低细粒度标注任务的难度。有了 UniSumEval,我们对九个最新的语言模型作为摘要生成器进行基准测试,洞察它们在不同输入情境和评估维度上的表现。进一步,我们对 SOTA 自动摘要评估器进行了彻底比较。本基准数据将在 https://github.com/DISL-Lab/UniSumEval-v1.0 上提供。

关键词

引用

@article{arxiv.2409.19898,
  title  = {UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs},
  author = {Yuho Lee and Taewon Yun and Jason Cai and Hang Su and Hwanjun Song},
  journal= {arXiv preprint arXiv:2409.19898},
  year   = {2024}
}

备注

Accepted at EMNLP-Findings 2024