中文

基于复杂全局注意力模块和频谱-时域损失的高保真语音超分辨网络

声音 2025-07-02 v1 人工智能 音频与语音处理

摘要

语音超分辨(SSR)通过提高采样率来增强低分辨率语音。虽然大多数 SSR 方法侧重于幅度重建,但近期研究强调相位重建对改进感知质量的重要性。因此,我们引入了 CTFT-Net,这是一个复杂时频转换网络,用于改进 SSR 任务中的幅度和相位重建。它包含一个复杂全局注意力模块来建模跨音素和跨频率的依赖关系,并使用复杂共谐器捕获长程和局部特征,提高频率重建和噪声鲁棒性。CTFT-Net 采用时域和多分辨率频域损失函数以获得更好的泛化能力。实验表明,CTFT-Net 在 VCTK 数据集上优于最先进的模型(NU-Wave、WSRGlow、NVSR、AERO),尤其在极端升频(2 kHz 升至 48 kHz)时,能够有效重建高频且无噪声伪影。

关键词

引用

@article{arxiv.2507.00229,
  title  = {A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss},
  author = {Tarikul Islam Tamiti and Biraj Joshi and Rida Hasan and Rashedul Hasan and Taieba Athay and Nursad Mamun and Anomadarshi Barua},
  journal= {arXiv preprint arXiv:2507.00229},
  year   = {2025}
}