Wu Chinese机器翻译评估基准:工作流程与分析
计算与语言
2024-10-15 v1
摘要
我们介绍FLORES+数据集作为现代Wu Chinese机器翻译模型的评估基准,并展示其与现有Wu数据集的兼容性。Wu Chinese与其他南方语言如普通话和粤语(广东话)不可互通,但使用一套与其他语言 profoundly重叠的汉字。Wu Chinese的使用人口是中国各语言中第二大人口,但该语言在年轻一代中使用量显著下降。我们将Wu Chinese确定为文本低资源语言,并解决其机器翻译模型的挑战。我们的贡献包括: (1)开源的人工翻译数据集、(2)关于数据集创建和验证实验的完整文档、(3)Wu Chinese规范化和分段的初步工具、(4)我们数据集的利益和局限性,以及对其他低资源语言的启示。
关键词
引用
@article{arxiv.2410.10278,
title = {Machine Translation Evaluation Benchmark for Wu Chinese: Workflow and Analysis},
author = {Hongjian Yu and Yiming Shi and Zherui Zhou and Christopher Haberland},
journal= {arXiv preprint arXiv:2410.10278},
year = {2024}
}
备注
EMNLP WMT 24 Open Language Data Initiative Shared Task