Wave-U-Mamba:面向高品质高效语音超分辨率的端到端框架
音频与语音处理
2025-02-04 v3 人工智能
声音
摘要
语音超分辨率(SSR)是通过恢复缺失的高频分量来增强低分辨率语音信号的任务。传统方法通常重建对数梅尔特征,然后通过声码器在波形域生成高分辨率语音。然而,由于梅尔特征缺乏相位信息,这会在重建阶段导致性能下降。鼓舞最近在选择性状态空间模型(SSMs)方面的进展,我们提出一种方法,称为Wave-U-Mamba,直接在时域执行SSR。在我们的比较研究中,包括WSRGlow、NU-Wave 2和AudioSR等模型,Wave-U-Mamba在各种低分辨率采样率下(从8 kHz到24 kHz)实现了最低的对数谱距离(LSD)。此外,主观人类评估采用满意度评分(MOS)表明,我们的方法产生的SSR具有自然且类似人的质量。Furthermore, Wave-U-Mamba在单张A100 GPU上以基线模型的9倍以上速度生成高分辨率语音,参数规模不足基线模型的2%。
关键词
引用
@article{arxiv.2409.09337,
title = {Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution},
author = {Yongjoon Lee and Chanwoo Kim},
journal= {arXiv preprint arXiv:2409.09337},
year = {2025}
}
备注
Accepted to ICASSP 2025