ForkNet:用于语音增强的时域与时频域联合建模
声音
2023-05-16 v1 音频与语音处理
摘要
以往语音增强研究多集中于单独建模时域或时频域信息,很少考虑同时建模两个域的潜在益处。由于这些域包含互补信息,将其结合或可提升模型性能。在本快报中,我们提出一种在单一模型中同时建模时域与时频域信息的新方法。我们以 DPT-FSNet(因果版本)模型为基线,通过用三个独立编码器替换原始编码器来修改编码器结构,分别致力于建模时域、实部-虚部与幅度信息。此外,我们在双路径处理块前后均引入特征融合模块,以更好地利用来自不同域的信息。实验结果表明,所提方法在保持相对紧凑的模型规模与较低计算复杂度的同时,优于现有的最先进因果模型。
引用
@article{arxiv.2305.08292,
title = {ForkNet: Simultaneous Time and Time-Frequency Domain Modeling for Speech Enhancement},
author = {Feng Dang and Qi Hu and Pengyuan Zhang and Yonghong Yan},
journal= {arXiv preprint arXiv:2305.08292},
year = {2023}
}