中文

结合辅助语言信息的改进自监督多语言语音表征学习

音频与语音处理 2022-12-08 v1 计算与语言 声音

摘要

多语言端到端模型已显示出相较单语系统的巨大改进。随着语音预训练方法的发展,诸如 XLSR 之类的自监督多语言语音表征学习已在提升多语言自动语音识别(ASR)性能方面取得成功。然而,类似于监督学习,多语言预训练也可能遭受语言干扰并进一步影响多语言系统的应用。本文引入若干技术,通过利用辅助语言信息改进自监督多语言预训练,包括在预训练阶段的语言对抗训练、语言嵌入与语言自适应训练。我们在一个包含 16 种语言的多语言 ASR 任务上进行实验。实验结果表明,相较标准 XLSR 模型获得 14.3% 的相对增益,相较无预训练多语言模型获得 19.8% 的相对增益。

关键词

引用

@article{arxiv.2212.03476,
  title  = {Improved Self-Supervised Multilingual Speech Representation Learning Combined with Auxiliary Language Information},
  author = {Fenglin Ding and Genshun Wan and Pengcheng Li and Jia Pan and Cong Liu},
  journal= {arXiv preprint arXiv:2212.03476},
  year   = {2022}
}

备注

Subimitted to ICASSP 2023