中文

CODET:一种用于机器翻译方言对比评估的基准

计算与语言 2024-02-06 v2

摘要

神经机器翻译(NMT)系统在处理源端语言变异时表现出有限的鲁棒性。当面临即便轻微的语言使用偏差(如不同领域或二语使用者引入的变体)时,其性能往往下降。直观上可将此观察扩展至涵盖方言变体,但允许社区在此维度上评估MT系统的工作有限。为缓解该问题,我们编撰并发布了CODET,一个涵盖十二种语言共891种不同变体的方言对比基准。我们还定量展示了大型MT模型在有效翻译方言变体时所面临的挑战。所有数据与代码均已发布。

关键词

引用

@article{arxiv.2305.17267,
  title  = {CODET: A Benchmark for Contrastive Dialectal Evaluation of Machine Translation},
  author = {Md Mahfuz Ibn Alam and Sina Ahmadi and Antonios Anastasopoulos},
  journal= {arXiv preprint arXiv:2305.17267},
  year   = {2024}
}