探索自监督学习离散词元用于多语言自动语音识别
计算与语言
2024-09-16 v1 声音
音频与语音处理
摘要
随着自监督学习(SSL)在语音相关任务中的进步,利用 SSL 生成的离散词元进行自动语音识别(ASR)的兴趣日益增长,因为它们提供了更快的处理技术。然而,以往的研究主要集中于使用 Fbank 特征的多语言 ASR 或使用离散词元的英语 ASR,在将离散词元应用于多语言 ASR 场景方面留下了空白。本研究对多种领先 SSL 模型在多个语言域中生成的离散词元进行了全面比较。我们旨在探索语音离散词元在单语和多语言 ASR 场景下跨多个语言域的性能和效率。实验结果表明,在七个语言域的 ASR 任务中,离散词元取得了与基于 Fbank 特征训练的系统相当的结果,在开发集和测试集上,平均词错误率(WER)分别绝对降低了 0.31% 和 1.76%(相对降低 2.80% 和 15.70%),特别是在波兰语测试集上,WER 绝对降低了 6.82%(相对降低 41.48%)。
引用
@article{arxiv.2409.08805,
title = {Exploring SSL Discrete Tokens for Multilingual ASR},
author = {Mingyu Cui and Daxin Tan and Yifan Yang and Dingdong Wang and Huimeng Wang and Xiao Chen and Xie Chen and Xunying Liu},
journal= {arXiv preprint arXiv:2409.08805},
year = {2024}
}
备注
Submitted to ICASSP 2025