自监督预训练表征用于端到端语音识别的探索
计算与语言
2021-10-12 v1 声音
音频与语音处理
摘要
语音数据上的自监督预训练已取得大量进展。从大量无转写数据中学习到语音信号的高保真表征,并展现出有前景的性能。近来,若干工作聚焦于在无领域限制的各种任务上评估自监督预训练表征的质量,例如 SUPERB。然而,此类评估并未在众多 ASR 基准语料库间提供全面比较。本文关注预训练语音表征在先进端到端自动语音识别(E2E-ASR)模型上的通用应用。我们选取若干预训练语音表征,并给出其在多种开源且公开可用的 E2E-ASR 语料库上的实验结果。在不修改后端模型架构或训练策略的情况下,部分使用预训练表征的实验(如采用 HuBERT 的 WSJ、WSJ0-2mix)达到或超越了当前最先进(SOTA)识别性能。此外,我们进一步探索了更多预训练表征是否有效的场景,例如跨语言或重叠语音。相关脚本、配置及训练好的模型已在 ESPnet 中发布,以便社区复现并改进我们的实验。
引用
@article{arxiv.2110.04590,
title = {An Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition},
author = {Xuankai Chang and Takashi Maekaku and Pengcheng Guo and Jing Shi and Yen-Ju Lu and Aswin Shanmugam Subramanian and Tianzi Wang and Shu-wen Yang and Yu Tsao and Hung-yi Lee and Shinji Watanabe},
journal= {arXiv preprint arXiv:2110.04590},
year = {2021}
}
备注
To appear in ASRU2021