单通道语音去混响时序卷积网络感受野分析
声音
2022-07-04 v3 机器学习
音频与语音处理
摘要
语音去混响通常是鲁棒语音处理任务中的重要需求。有监督深度学习(DL)模型在单通道语音去混响上取得最先进性能。时序卷积网络(TCNs)常用于语音增强任务中的序列建模。TCNs 的一个特征是具有依赖于特定模型配置的感受野(RF),其决定了可观测以产生单个输出帧的输入帧数量。已有研究表明 TCNs 能够对模拟语音数据进行去混响,但文献中仍缺乏尤其是聚焦 RF 的透彻分析。本文分析了去混响性能对 TCNs 模型大小与 RF 的依赖关系。使用扩展以包含更大 T60 值房间脉冲响应(RIRs)的 WHAMR 语料库的 experiments 表明,在训练较小 TCN 模型时,更大的 RF 可显著改善性能。还表明在对具有更大 RT60 值的 RIRs 去混响时,TCNs 受益于更宽的 RF。
引用
@article{arxiv.2204.06439,
title = {Receptive Field Analysis of Temporal Convolutional Networks for Monaural Speech Dereverberation},
author = {William Ravenscroft and Stefan Goetze and Thomas Hain},
journal= {arXiv preprint arXiv:2204.06439},
year = {2022}
}
备注
Accepted at EUSIPCO 2022