中文

XLST:用于低资源语音识别的跨语言自训练多语言表征学习

音频与语音处理 2021-03-16 v1 计算与语言 声音

摘要

本文提出一种弱监督多语言表征学习框架,称为跨语言自训练(XLST)。XLST 能够利用来自高资源语言的少量标注数据改进多语言无标注数据上的表征学习。具体而言,XLST 使用有监督训练模型产生初始表征,并让另一模型通过最大化两模型输出嵌入间的相似性从中学习。此外,采用了滑动平均机制与多视图数据增强,实验表明它们对 XLST 至关重要。已在 CommonVoice 语料库上进行综合实验以评估 XLST 的有效性。在 5 个下游低资源 ASR 任务上的结果显示,我们的多语言预训练模型利用额外的 100 小时标注英语数据,相较最先进的自监督方法实现了相对 18.6% 的 PER 降低。

关键词

引用

@article{arxiv.2103.08207,
  title  = {XLST: Cross-lingual Self-training to Learn Multilingual Representation for Low Resource Speech Recognition},
  author = {Zi-Qiang Zhang and Yan Song and Ming-Hui Wu and Xin Fang and Li-Rong Dai},
  journal= {arXiv preprint arXiv:2103.08207},
  year   = {2021}
}

备注

5 pages, 1 figure