中文

超越 N 元:重新思考多语言 abstractive 总结的评估指标与策略

计算与语言 2025-07-14 v1

摘要

自动 n 元-gram 基于指标如 ROUGE 被广泛用于评估生成任务如总结。虽然这些指标被认为是对英文人类评估的指示性(即便不完美)的衡量标准,但其适用于其他语言的适用性尚不明确。为此,我们系统评估了跨语言任务中用于评估生成的 n 元-gram 基于和神经网络基于指标的有效性。具体而言,我们设计了一个跨八种语言、来自四个语言类型族(屈折、独立、低融合、高融合),覆盖低资源和高资源环境的大型评估套件,以分析其与人类判断之间的相关性。我们的发现突显了评估指标对语言类型的敏感性。例如,在融合语言中,n 元-gram 基于指标的相关性低于独立和屈折语言。我们也展示了适当的分词可以显著缓解此问题对于形态丰富的融合语言,甚至有时会反转负面趋势。此外,我们表明专为评估任务训练的神经网络指标,如 COMET,始终优于其他神经网络指标,并在低资源语言中更好地与人类判断相关。总体而言,我们的分析凸显了 n 元-gram 指标在融合语言中的局限性,倡导在评估任务方面投资更多资源用于神经网络指标。

关键词

引用

@article{arxiv.2507.08342,
  title  = {Beyond N-Grams: Rethinking Evaluation Metrics and Strategies for Multilingual Abstractive Summarization},
  author = {Itai Mondshine and Tzuf Paz-Argaman and Reut Tsarfaty},
  journal= {arXiv preprint arXiv:2507.08342},
  year   = {2025}
}

备注

ACL 2025 Main