中文

构建方言-普通话代码混合语料库的方法探索:以台湾闽南语为例

计算与语言 2023-01-24 v1 人工智能

摘要

在自然语言处理(NLP)中,代码混合(CM)是一项具有挑战性的任务,尤其当混合语言包含方言时。在新加坡、印度尼西亚和马来西亚等东南亚国家,闽南语-普通话是华人移民中最广泛的代码混合语言对,在台湾也很常见。然而,诸如闽南语之类的方言往往资源匮乏且缺乏官方书写系统,限制了方言 CM 研究的发展。本文我们提出一种构建闽南语-普通话 CM 数据集的方法,以缓解该限制,克服汉藏语系下的形态问题,并通过基于语言学的工具包提供高效的闽南语分词方法。此外,我们使用所提出的数据集并采用迁移学习来训练 XLM(跨语言语言模型)以用于翻译任务。为适配代码混合场景,我们对 XLM 做了轻微调整。我们发现,通过使用语言知识、规则与语言标签,该模型在 CM 数据翻译上取得了良好结果,同时保持了单语翻译质量。

关键词

引用

@article{arxiv.2301.08937,
  title  = {Exploring Methods for Building Dialects-Mandarin Code-Mixing Corpora: A Case Study in Taiwanese Hokkien},
  author = {Sin-En Lu and Bo-Han Lu and Chao-Yi Lu and Richard Tzong-Han Tsai},
  journal= {arXiv preprint arXiv:2301.08937},
  year   = {2023}
}

备注

The paper was accepted by EMNLP 2022 findings