零样本机器翻译评估对低资源印度语言的效果如何?
计算与语言
2024-06-07 v1
摘要
虽然机器翻译评估主要针对高资源语言进行研究,但由于数据和模型的日益可用,最近对低资源语言的评估产生了兴趣。在本文中,我们专注于一个零样本评估设置,重点关注低资源印度语言,即阿萨姆语、卡纳达语、迈蒂利语和旁遮普语。我们收集了足够的多维质量指标(MQM)和直接评估(DA)标注,以创建测试集,并对大量自动评估指标进行元评估。我们观察到,即使是已知具有零样本性能的学习指标,其与人工标注的 Kendall Tau 和 Pearson 相关性也分别仅为 0.32 和 0.45。合成数据方法显示出混合的结果,总体上对这些语言没有太大帮助缩小差距。这表明低资源评估仍有很长的路要走。
引用
@article{arxiv.2406.03893,
title = {How Good is Zero-Shot MT Evaluation for Low Resource Indian Languages?},
author = {Anushka Singh and Ananya B. Sai and Raj Dabre and Ratish Puduppully and Anoop Kunchukuttan and Mitesh M Khapra},
journal= {arXiv preprint arXiv:2406.03893},
year = {2024}
}