中文

AllSummedUp:用于比较文本摘要评估指标的开源框架

计算与语言 2025-09-01 v1 人工智能

摘要

本文探讨了自动文本摘要评估中可重复性挑战。基于在六个代表性指标上进行的实验,从经典方法如ROUGE到最新的基于大语言模型的方法(G-Eval、SEval-Ex),我们指出了文献中报告的性能与我们观察到的实际性能之间的显著差异。我们引入了一个统一、开源的框架,适用于SummEval数据集,旨在支持公平且透明的评估指标比较。我们的结果揭示了一个结构性权衡:与人类判断力最高一致性的指标倾向于计算密集型且在不同运行中的稳定性较差。除了比较分析之外,本研究还强调了依赖大语言模型进行评估的关键问题,强调其随机性、技术依赖性和有限的可重复性。我们倡导采用更健壮的评估协议,包括详尽的文档和方法论的标准化,以确保自动摘要评估的更大可靠性。

关键词

引用

@article{arxiv.2508.21389,
  title  = {AllSummedUp: un framework open-source pour comparer les metriques d'evaluation de resume},
  author = {Tanguy Herserant and Vincent Guigue},
  journal= {arXiv preprint arXiv:2508.21389},
  year   = {2025}
}

备注

in French language