中文

FUSE:基于岭回归与随机森林的原住民语言机器翻译评估指标

计算与语言 2025-11-03 v3

摘要

本文介绍了 RaaVa 团队在 AmericasNLP 2025 共享任务 3(关于面向原住民语言的机器翻译自动评估指标)中获奖作品,其中我们的系统基于与人类注释的平均 Pearson 相关系数排名第一。我们提出特征-联合评分器 (FUSE) 用于评估,FUSE 将岭回归和梯度提升树相结合,以建模翻译质量。除 FUSE 外,我们还探索了五种不同组合语言相似性特征和学习范式的替代方法。FUSE 分数凸显了结合词汇、音素、语义和模糊 token 相似性与基于学习的建模以提高原住民语言机器翻译评估的有效性。原住民语言的机器翻译因多义性、复杂形态学以及非标准化的拼写体系而面临独特挑战。BLEU、TER 和 ChrF 等传统自动指标往往难以捕捉语义充分性和流畅性等深层方面。我们提出的框架(此前称为 FUSE)集成了多语言句子嵌入和音素编码,以更好地对齐人类评估。我们在人工标注的开发集上训练受监督模型,并在 held-out 测试数据上进行评估。结果表明,FUSE 在与人类判断的 Pearson 和 Spearman 相关系数上持续实现更高,为低资源环境下的机器翻译评估提供了稳健且语言学上有信息量的解决方案。

关键词

引用

@article{arxiv.2504.00021,
  title  = {FUSE : A Ridge and Random Forest-Based Metric for Evaluating MT in Indigenous Languages},
  author = {Rahul Raja and Arpita Vats},
  journal= {arXiv preprint arXiv:2504.00021},
  year   = {2025}
}

备注

NAACL 2025 Workshop on NLP for Indigenous Languages of the Americas