未见语言对中的语码转换文本合成
计算与语言
2023-07-10 v2 人工智能
摘要
现有关于语码转换文本合成的工作大多需要在目标语言对的语码转换文本上训练,限制了模型在缺乏语码转换数据场景下的部署。本文研究为训练数据中不存在的语言对合成语码转换文本的问题。我们提出 GLOSS,一种构建于预训练多语言机器翻译模型(PMMTM)之上并带有额外语码转换模块的模型。该模块(适配器或额外前缀)在训练时从语码转换数据中学习语码转换模式,而 GLOSS 的主要组件即 PMMTM 保持冻结。仅调整语码转换模块的设计防止了模型对受限的语码转换训练数据过拟合。因此,GLOSS 展现出泛化能力,可合成更广泛语言对范围内的语码转换文本。此外,我们开发了针对目标语言对的自训练算法,进一步增强 GLOSS 的可靠性。在四个语言对上的自动评测表明,与强基线相比,GLOSS 的 BLEU 和 METEOR 分数相对提升至少 55%。在两个语言对上的人工评测进一步验证了 GLOSS 的成功。
引用
@article{arxiv.2305.16724,
title = {Code-Switched Text Synthesis in Unseen Language Pairs},
author = {I-Hung Hsu and Avik Ray and Shubham Garg and Nanyun Peng and Jing Huang},
journal= {arXiv preprint arXiv:2305.16724},
year = {2023}
}
备注
Paper accepted by ACL2023 as a Finding paper