面向鲁棒语音识别的多任务自监督学习
音频与语音处理
2020-04-21 v2 计算与语言
机器学习
声音
摘要
尽管对无监督学习的兴趣日益增长,从非标注音频中提取有意义的知识仍是一项开放挑战。为朝此方向迈进一步,我们近期提出了一种问题无关语音编码器(PASE),其结合卷积编码器与多个称为工人的神经网络,致力于求解自监督问题(即不需要人工标注作为真值的问题)。已证明 PASE 能够捕获相关的语音信息,包括说话人声纹与音素。本文提出 PASE+,即 PASE 的改进版本,用于噪声与混响环境下的鲁棒语音识别。为此,我们采用在线语音失真模块,以多种随机扰动污染输入信号。随后我们提出一种改进的编码器,通过循环与卷积网络的高效组合更好地学习短期与长期语音动态。最后,我们精炼自监督中所用的工人集合以促使更好的协作。在 TIMIT、DIRHA 和 CHiME-5 上的结果表明,PASE+ 显著优于先前版本的 PASE 以及常见声学特征。有趣的是,PASE+ 学习到了适用于高度失配声学条件的可迁移表征。
引用
@article{arxiv.2001.09239,
title = {Multi-task self-supervised learning for Robust Speech Recognition},
author = {Mirco Ravanelli and Jianyuan Zhong and Santiago Pascual and Pawel Swietojanski and Joao Monteiro and Jan Trmal and Yoshua Bengio},
journal= {arXiv preprint arXiv:2001.09239},
year = {2020}
}
备注
In Proc. of ICASSP 2020