关于 ASR 中原始波形特征提取的架构与训练
音频与语音处理
2021-10-06 v3 计算与语言
机器学习
声音
摘要
随着基于神经网络的建模在自动语音识别(ASR)中的成功,许多研究探索了直接基于原始波形的声学建模与特征提取器的学习。近来,一条研究路线聚焦于在仅音频数据上无监督预训练特征提取器以提升下游 ASR 性能。本工作中,我们在无额外无转录数据的情况下,针对混合 ASR 系统考察了其中一种前端框架即 wav2vec 的效用。我们将该框架与人工定义的标准 Gammatone 特征集,以及从有监督训练的 ASR 系统声学模型中提取的特征进行比较。我们研究了使用预训练特征提取器的益处,并探索如何额外利用以不同特征训练的现有声学模型。最后,我们系统性地检验了所述特征的组合以进一步提升性能。
引用
@article{arxiv.2104.04298,
title = {On Architectures and Training for Raw Waveform Feature Extraction in ASR},
author = {Peter Vieting and Christoph Lüscher and Wilfried Michel and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2104.04298},
year = {2021}
}
备注
Accepted for ASRU 2021