用于端到端多方言语音识别的分层快速自适应
声音
2022-04-22 v1 音频与语音处理
摘要
方言变异性给自动语音识别(ASR)建模带来了巨大挑战。尽管基于 one-hot 方言向量的自适应系统被广泛使用,但它们需要关于目标方言的先验知识且无法处理未见过的方言。此外,简单地拼接方言嵌入并未充分利用方言知识,限制了改进效果。在本工作中,我们旨在通过将一种新颖的分层自适应结构注入到 E2E ASR 模型编码器中来解决这些问题。适配器层在方言空间中编码任意方言,并辅助 ASR 模型识别带方言的语音。给定一条语音,该自适应结构提取相应的方言信息,并通过所有方言基的线性组合将输入声学特征变换为方言相关特征。我们进一步探索了自适应层的注入位置、方言基的数量以及不同类型的方言基,以实现更好的方言自适应。实验结果表明,与基线相比,所提自适应结构在 AESRC2020 方言数据集和 Librispeech 数据集上分别带来了 12% 和 10% 的相对词错误率(WER)降低。
引用
@article{arxiv.2204.09883,
title = {Layer-wise Fast Adaptation for End-to-End Multi-Accent Speech Recognition},
author = {Xun Gong and Yizhou Lu and Zhikai Zhou and Yanmin Qian},
journal= {arXiv preprint arXiv:2204.09883},
year = {2022}
}
备注
Accepted by Interspeech2021