中文

用于单通道语音去混响的语句加权多膨胀时序卷积网络

声音 2022-07-26 v3 机器学习 音频与语音处理

摘要

语音去混响是许多语音技术应用中的重要环节。该领域近期工作主要由深度神经网络模型主导。时序卷积网络(TCN)是一种被提出用于去混响语音任务中序列建模的深度学习模型。本文中提出一种加权多膨胀深度可分离卷积,以替换 TCN 模型中的标准深度可分离卷积。该提出的卷积使 TCN 能够在网络中每个卷积块动态地聚焦于其感受野中或多或少的局部信息。研究表明,该加权多膨胀时序卷积网络(WD-TCN)在各种模型配置下始终优于 TCN,且使用 WD-TCN 模型是比增加卷积块数量更参数高效的性能提升方法。相对于基线 TCN 的最佳性能提升为 0.55 dB 尺度不变信号失真比(SISDR),且性能最佳的 WD-TCN 模型在 WHAMR 数据集上达到 12.26 dB SISDR。

关键词

引用

@article{arxiv.2205.08455,
  title  = {Utterance Weighted Multi-Dilation Temporal Convolutional Networks for Monaural Speech Dereverberation},
  author = {William Ravenscroft and Stefan Goetze and Thomas Hain},
  journal= {arXiv preprint arXiv:2205.08455},
  year   = {2022}
}

备注

Accepted at IWAENC 2022