CODET:一种用于机器翻译方言对比评估的基准
计算与语言
2024-02-06 v2
摘要
神经机器翻译(NMT)系统在处理源端语言变异时表现出有限的鲁棒性。当面临即便轻微的语言使用偏差(如不同领域或二语使用者引入的变体)时,其性能往往下降。直观上可将此观察扩展至涵盖方言变体,但允许社区在此维度上评估MT系统的工作有限。为缓解该问题,我们编撰并发布了CODET,一个涵盖十二种语言共891种不同变体的方言对比基准。我们还定量展示了大型MT模型在有效翻译方言变体时所面临的挑战。所有数据与代码均已发布。
引用
@article{arxiv.2305.17267,
title = {CODET: A Benchmark for Contrastive Dialectal Evaluation of Machine Translation},
author = {Md Mahfuz Ibn Alam and Sina Ahmadi and Antonios Anastasopoulos},
journal= {arXiv preprint arXiv:2305.17267},
year = {2024}
}