西班牙语和巴斯que语摘要指标:自动评分与 LLM 评判是否与人类一致?
计算与语言
2025-04-15 v2 人工智能
摘要
关于评估指标和 LLM 作为评判模型的研究在自动文本摘要领域主要聚焦于英语,限制了我们对其在其他语言中有效性的了解。通过我们全新的数据集 BASSE(BAsque and Spanish Summarization Evaluation),我们弥补了这一不足,收集了2040份以人工或五种 LLM(采用四种不同提示)生成的巴斯que语和西班牙语抽象摘要的人类评判。对于每份摘要,评注者按5点likert比例尺对其进行五个维度的评估:连贯性、一致性、流畅性、相关性和5W1H。我们利用这些数据重新评估用于评估摘要的传统自动指标,以及在英语中表现突出的几种 LLM 作为评判模型。我们的结果表明,当前专有的评判 LLM 与人类评判的最高相关性,其后是基于特定评估标准的自动指标,而开源评判 LLM 的表现较差。我们公开发布 BASSE 数据集及代码,并随之发布首个规模为22,525篇新闻文章的巴斯que语摘要数据集(含副标题)。
引用
@article{arxiv.2503.17039,
title = {Summarization Metrics for Spanish and Basque: Do Automatic Scores and LLM-Judges Correlate with Humans?},
author = {Jeremy Barnes and Naiara Perez and Alba Bonet-Jover and Begoña Altuna},
journal= {arXiv preprint arXiv:2503.17039},
year = {2025}
}