中文

SSA-COMET:评估资源匮乏的非洲语言机器翻译的 LLM 是否优于学习型指标?

计算与语言 2025-10-07 v2 人工智能

摘要

评估资源匮乏的非洲语言机器翻译(MT)质量 remains a significant 挑战,因现有指标常在语言覆盖范围有限且低资源场景性能差。虽然近期工作如 AfriCOMET 已解决部分问题,但仍受限于小规模评估集、缺乏针对非洲语言的公开训练数据,以及在极端低资源情境下的不一致表现。本文引入 SSA-MTE 数据集,覆盖来自新闻领域的 14 对非洲语言,包含来自多样化 MT 系统的 73,000 条句子级标注。基于此数据,我们开发了改进版的 reference-based 与 reference-free 评估指标 SSA-COMET 和 SSA-COMET-QE。我们还对比评估了基于 GPT-4o、Claude-3.7 和 Gemini 2.5 Pro 等领先 LLM 的 prompt-based 方法。实验结果表明,SSA-COMET 在 Twi、Luo、Yoruba 等低资源语言上显著优于 AfriCOMET,且与本研究中表现最强的 Gemini 2.5 Pro 相当。所有资源均采用开放许可发布,以支持后续研究。

关键词

引用

@article{arxiv.2506.04557,
  title  = {SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?},
  author = {Senyu Li and Jiayi Wang and Felermino D. M. A. Ali and Colin Cherry and Daniel Deutsch and Eleftheria Briakou and Rui Sousa-Silva and Henrique Lopes Cardoso and Pontus Stenetorp and David Ifeoluwa Adelani},
  journal= {arXiv preprint arXiv:2506.04557},
  year   = {2025}
}