结合谱特征与自监督特征的低资源语音识别与翻译
计算与语言
2022-04-20 v2 声音
音频与语音处理
摘要
自监督学习(Self-Supervised Learning, SSL)模型已成功应用于各类基于深度学习的语音任务,尤其是数据量有限的任务。然而,SSL表征的质量高度依赖于SSL训练域与目标数据域之间的相关性。相反,诸如log Mel-filterbanks之类的谱特征(Spectral Feature, SF)提取器是手工设计不可学习的组件,可能对域偏移更具鲁棒性。本文检验了将不可学习的SF提取器与SSL模型相结合是低资源语音任务有效方法的假设。我们提出一种可学习且可解释的框架来结合SF与SSL表征。所提框架在三个低资源数据集的自动语音识别(Automatic Speech Recognition, ASR)与语音翻译(Speech Translation, ST)任务上显著优于基线与SSL模型。我们还设计了一种基于混合专家的组合模型。最后这一模型揭示,在SSL训练集与目标语言数据之间存在域失配时,SSL模型相对于传统SF提取器的相对贡献非常小。
引用
@article{arxiv.2204.02470,
title = {Combining Spectral and Self-Supervised Features for Low Resource Speech Recognition and Translation},
author = {Dan Berrebbi and Jiatong Shi and Brian Yan and Osbel Lopez-Francisco and Jonathan D. Amith and Shinji Watanabe},
journal= {arXiv preprint arXiv:2204.02470},
year = {2022}
}
备注
5 pages, 2 figures, submitted to Interspeech 2022