中文

Wu Chinese机器翻译评估基准:工作流程与分析

计算与语言 2024-10-15 v1

摘要

我们介绍FLORES+数据集作为现代Wu Chinese机器翻译模型的评估基准,并展示其与现有Wu数据集的兼容性。Wu Chinese与其他南方语言如普通话和粤语(广东话)不可互通,但使用一套与其他语言 profoundly重叠的汉字。Wu Chinese的使用人口是中国各语言中第二大人口,但该语言在年轻一代中使用量显著下降。我们将Wu Chinese确定为文本低资源语言,并解决其机器翻译模型的挑战。我们的贡献包括: (1)开源的人工翻译数据集、(2)关于数据集创建和验证实验的完整文档、(3)Wu Chinese规范化和分段的初步工具、(4)我们数据集的利益和局限性,以及对其他低资源语言的启示。

关键词

引用

@article{arxiv.2410.10278,
  title  = {Machine Translation Evaluation Benchmark for Wu Chinese: Workflow and Analysis},
  author = {Hongjian Yu and Yiming Shi and Zherui Zhou and Christopher Haberland},
  journal= {arXiv preprint arXiv:2410.10278},
  year   = {2024}
}

备注

EMNLP WMT 24 Open Language Data Initiative Shared Task