中文

多语言联合训练的声学与书面词嵌入

计算与语言 2020-06-26 v1 声音 音频与语音处理

摘要

声学词嵌入(AWEs)是口语词段的向量表示。AWEs可与字符序列嵌入联合学习,以生成具有语音意义的书面词嵌入,或称声学接地词嵌入(AGWEs)。此类嵌入已用于改进语音检索、识别与口语词发现。本文将该思想扩展至多种低资源语言。我们利用多语言的语音转写数据,联合训练AWE模型与AGWE模型。预训练模型可用于未见过的零资源语言,或针对低资源语言数据微调。我们还研究以区别性特征作为音素标签的替代方案,以更好地共享跨语言信息。我们在十二种语言的词判别任务上测试模型。当以十一种语言训练并测试于剩余未见语言时,我们的模型优于动态时间规整等传统无监督方法。在新语言上仅用一小时甚至十分钟数据微调预训练模型后,性能通常远优于仅用目标语言数据训练。我们还发现,相较于字符序列,语音监督可提升性能,且区别性特征监督有助于处理目标语言中的未见音素。

关键词

引用

@article{arxiv.2006.14007,
  title  = {Multilingual Jointly Trained Acoustic and Written Word Embeddings},
  author = {Yushi Hu and Shane Settle and Karen Livescu},
  journal= {arXiv preprint arXiv:2006.14007},
  year   = {2020}
}