基于张量列网络的多通道语音增强张量到向量回归方法
音频与语音处理
2020-02-04 v1 计算与语言
机器学习
神经与进化计算
声音
摘要
我们提出一种用于多通道语音增强的张量到向量回归方法,以解决输入尺寸爆炸和隐藏层规模扩张的问题。其核心思想是将传统的基于深度神经网络(DNN)的向量到向量回归公式置于张量列网络(TTN)框架下。TTN 是近期出现的用于紧凑表示具有全连接隐藏层的深度模型的方案。因此 TTN 保持了 DNN 的表达能力,但涉及的可训练参数数量大幅减少。此外,TTN 按设计可处理多维张量输入,这恰好匹配多通道语音增强所需的设置。我们首先给出了从 DNN 到 TTN 回归的理论扩展。接着,我们表明 TTN 能以少得多的参数达到与 DNN 相当的语音增强质量,例如,在单通道场景中观察到参数从 2700 万仅减少到 500 万。TTN 还通过略微增加可训练参数数量将 PESQ 从 2.86 提升至 2.96。最后,在 8 通道条件下,TTN 使用 2000 万参数实现了 3.12 的 PESQ,而具有 6800 万参数的 DNN 仅能达到 3.06 的 PESQ。我们的实现可在 https://github.com/uwjunqi/Tensor-Train-Neural-Network 在线获取。
引用
@article{arxiv.2002.00544,
title = {Tensor-to-Vector Regression for Multi-channel Speech Enhancement based on Tensor-Train Network},
author = {Jun Qi and Hu Hu and Yannan Wang and Chao-Han Huck Yang and Sabato Marco Siniscalchi and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2002.00544},
year = {2020}
}
备注
Accepted to ICASSP 2020. Update reproducible code