基于软自注意力学习可解释滤波器用于原始波形语音识别
音频与语音处理
2020-01-22 v1
摘要
从原始波形进行语音识别涉及利用卷积层在神经声学模型的第一层学习信号的频谱分解。在这项工作中,我们提出了一种使用软自注意力的原始波形卷积滤波器学习方法。所提模型中的声学滤波器组使用参数化余弦调制高斯滤波器组实现,其参数被学习得到。网络嵌套(network-in-network)架构提供自注意力以在子带滤波器上生成注意力权重。注意力加权的对数滤波器组能量被送入声学模型以完成语音识别任务。实验在 Aurora-4(加性噪声含信道失真)和 CHiME-3(加性噪声含混响)数据库上进行。在这些实验中,基于注意力的滤波器学习方法相比基线梅尔滤波器组特征及其他鲁棒前端在 ASR 性能上提供了可观的提升(在 Aurora-4 数据集上相对词错误率较基线特征平均相对改善 7%,在 CHiME-3 数据库上为 5%)。利用自注意力权重,我们还给出了针对 ASR 任务的滤波器可解释性分析。
引用
@article{arxiv.2001.07067,
title = {Interpretable Filter Learning Using Soft Self-attention For Raw Waveform Speech Recognition},
author = {Purvi Agrawal and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2001.07067},
year = {2020}
}