面向多语言多领域的 LLM 汇要生成多维评估
计算与语言
2025-06-03 v1 人工智能
摘要
文本汇要的评估框架在领域覆盖性和指标方面不断演进。然而,现有基准仍缺乏领域特定的评估标准,主要以英语为中心,且因推理复杂难以进行人工标注。为此,我们引入 MSumBench,提供对英语和中文汇要的多维、多领域评估。它还包含每个领域的专门评估标准,利用多主体辩论系统提高标注质量。通过对八个现代汇要模型进行评估,我们发现不同领域和语言上的表现呈现出distinct模式。我们进一步审查了大语言模型作为汇要评估器的作用,分析了其评估与汇要能力之间的相关性,揭示了其对自生成汇要评估中存在系统性偏差。本基准数据集已公开于 https://github.com/DISL-Lab/MSumBench。
引用
@article{arxiv.2506.00549,
title = {Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages},
author = {Hyangsuk Min and Yuho Lee and Minjeong Ban and Jiaqi Deng and Nicole Hee-Yeon Kim and Taewon Yun and Hang Su and Jason Cai and Hwanjun Song},
journal= {arXiv preprint arXiv:2506.00549},
year = {2025}
}
备注
34 pages, 6 figures