利用单语数据训练语码转换语言模型
计算与语言
2020-05-22 v2
摘要
语码转换数据的缺乏给语码转换(CS)语言模型的训练带来了困难。我们提出一种仅使用单语数据训练此类 CS 语言模型的方法。通过对基于 RNN 的语言模型中的输出投影矩阵进行约束与归一化,我们将不同语言的嵌入彼此拉近。数值与可视化结果表明,所提出的方法显著提升了在单语数据上训练的 CS 语言模型的性能。所提出的方法可与使用人工生成的 CS 数据训练 CS 语言模型相媲美甚至更优。我们还额外使用无监督双语词翻译来分析不同语言中语义等价的词是否被映射在一起。
引用
@article{arxiv.1911.06003,
title = {Training a code-switching language model with monolingual data},
author = {Shun-Po Chuang and Tzu-Wei Sung and Hung-Yi Lee},
journal= {arXiv preprint arXiv:1911.06003},
year = {2020}
}
备注
Accepted as an oral presentation in ICASSP 2020