中文

极低资源机器翻译评估:ChrF++ 与 BLEU 指标的比较研究

计算与语言 2026-02-20 v1

摘要

在极低资源语言(ELRL)场景中评估机器翻译(MT)质量具有独特挑战,因为诸如 BLEU 等常用指标在高资源场景中效果良好,却在数据稀缺情境下常常误表质量。本文对 BLEU(基于 n 元语法的指标)和 ChrF++(基于字符的指标)在 ELRL 设置下的 MT 评估进行比较分析。我们检查每种指标如何响应包括幻觉、重复、源文本复制和 diacritic(matra)变体在内的翻译制造 artifact。实验涉及 Magahi、Bhojpuri 和 Chhattisgarhi 三种 ELRL,重点关注大语言模型(LLM)和神经机器翻译(NMT)系统的输出。尽管近期研究常仅依赖 ChrF++,但我们的发现表明,尽管 BLEU 的绝对分数较低,却提供了补充的词汇精确度洞察,提高了可解释性。

关键词

引用

@article{arxiv.2602.17425,
  title  = {Evaluating Extremely Low-Resource Machine Translation: A Comparative Study of ChrF++ and BLEU Metrics},
  author = {Sanjeev Kumar and Preethi Jyothi and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2602.17425},
  year   = {2026}
}

备注

6 pages