低资源神经机器翻译:关于港区书面与口语语言的案例研究
计算与语言
2025-05-26 v1
摘要
港区大多数居民能够阅读并书写标准中文,但日常生活中主要使用粤语。粤语可以被转写为中文字符,这就构成了所谓的书面粤语。书面粤语在词汇和语法上与标准书面中文存在显著差异。书面粤语的涌现日益明显。与Mandarin-speaking人群和粤语-speaking人群之间的交互增多,导致需要在中文和粤语之间进行自动翻译的需求日益清晰。本文描述了一个基于Transformer的神经机器翻译(NMT)系统,用于书面中文到书面粤语的翻译。鉴于中文和粤语之间的平行文本数据极其稀缺,本研究的主要焦点之一是为NMT准备大量训练数据的工作。在收集了来自前期语言学研究和零散互联网资源的28K平行句子之后,我们设计了一种有效的方法,通过从中文维基百科和粤语维基百科上的平行文章中自动提取语义相似的句子对,获取了72K平行句子。我们表明,利用从维基百科中挖掘的高度相似句子对在所有测试集上都能提升翻译性能。我们的系统在6个8个测试集上的BLEU分数均超过百度翻译的中文到粤语翻译。翻译实例表明,您的系统能够捕捉到标准中文与口语粤语之间的重要语言转换。
引用
@article{arxiv.2505.17816,
title = {Low-Resource NMT: A Case Study on the Written and Spoken Languages in Hong Kong},
author = {Hei Yi Mak and Tan Lee},
journal= {arXiv preprint arXiv:2505.17816},
year = {2025}
}
备注
Proceedings of the 2021 5th International Conference on Natural Language Processing and Information Retrieval