语码转换的语言建模:评测、单语数据整合与判别训练
计算与语言
2019-11-12 v3
摘要
我们关注自动语音识别(ASR)语境下语码转换语言的语言建模问题。语码转换语言的语言建模至少因以下三点而具挑战性:(1)缺乏可用的大规模语码转换训练数据;(2)缺乏以 ASR 为导向、又能将语言建模性能与 ASR 系统其他复杂因素隔离的可复现评测设置;(3)对生成式建模的依赖。我们着手解决这三个问题:提出一种与 ASR 系统及词表选择解耦的、受 ASR 驱动的评测设置,并提供英西语码转换的评测数据集。该设置适用于判别训练方法,我们证明其优于生成式语言建模。最后,我们探索多种训练协议,并验证了先以大量单语数据训练、再以少量语码转换数据微调的有效性,该结论对生成式与判别式两种情况均成立。
引用
@article{arxiv.1810.11895,
title = {Language Modeling for Code-Switching: Evaluation, Integration of Monolingual Data, and Discriminative Training},
author = {Hila Gonen and Yoav Goldberg},
journal= {arXiv preprint arXiv:1810.11895},
year = {2019}
}
备注
EMNLP 2019