结合辅助语言信息的改进自监督多语言语音表征学习
音频与语音处理
2022-12-08 v1 计算与语言
声音
摘要
多语言端到端模型已显示出相较单语系统的巨大改进。随着语音预训练方法的发展,诸如 XLSR 之类的自监督多语言语音表征学习已在提升多语言自动语音识别(ASR)性能方面取得成功。然而,类似于监督学习,多语言预训练也可能遭受语言干扰并进一步影响多语言系统的应用。本文引入若干技术,通过利用辅助语言信息改进自监督多语言预训练,包括在预训练阶段的语言对抗训练、语言嵌入与语言自适应训练。我们在一个包含 16 种语言的多语言 ASR 任务上进行实验。实验结果表明,相较标准 XLSR 模型获得 14.3% 的相对增益,相较无预训练多语言模型获得 19.8% 的相对增益。
引用
@article{arxiv.2212.03476,
title = {Improved Self-Supervised Multilingual Speech Representation Learning Combined with Auxiliary Language Information},
author = {Fenglin Ding and Genshun Wan and Pengcheng Li and Jia Pan and Cong Liu},
journal= {arXiv preprint arXiv:2212.03476},
year = {2022}
}
备注
Subimitted to ICASSP 2023