中文

基于相关性加权的语音与音频信号可解释表示学习

音频与语音处理 2020-11-05 v1 声音

摘要

从原始数据学习可解释表示对语音等时间序列数据构成重大挑战。本工作中,我们提出一种相关性加权方案,可在模型前向传播过程中解释语音表示。该相关性加权通过执行特征选择任务的子网络方法实现。将相关性子网络应用于在原始语音信号上运行的卷积神经网络模型第一层的输出,充当带相关性加权的声学滤波器组(FB)层。类似的相关性子网络应用于第二卷积层,执行带相关性加权的调制滤波器组学习。由相关性子网络、卷积层与前馈层构成的完整声学模型在 Aurora-4、CHiME-3 和 VOiCES 数据集上针对含噪与混响语音的语音识别任务进行训练。所提表示学习框架还应用于 UrbanSound8K 数据集上的声音分类任务。对模型所学相关性权重的详细分析表明,相关性权重捕获了底层语音/音频内容的信息。此外,语音识别与声音分类实验表明,在神经网络架构中引入相关性加权显著提升了性能。

关键词

引用

@article{arxiv.2011.02136,
  title  = {Interpretable Representation Learning for Speech and Audio Signals Based on Relevance Weighting},
  author = {Purvi Agrawal and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2011.02136},
  year   = {2020}
}

备注

arXiv admin note: text overlap with arXiv:2011.00721