Smule Renaissance Small:高效通用人声恢复
声音
2025-10-27 v1
摘要
消费设备上的人声录音常常受到多重并存退化的影响:噪声、混响、带限和削波。我们提出了 Smule Renaissance Small( SRS),一个紧凑的单阶段模型,可直接在复杂 STFT 域中进行端到端人声恢复。通过融合相位感知损失,SRS 能够在提高频率分辨率的同时,在 iPhone 12 CPU 上实现 48 kHz 条件下的 10.5 倍实时推理。即使未进行语音训练,SRS 在 DNS 5 挑战盲集上也优于强大的 GAN 基线,并与计算密集型 flow-matching 系统接近。为在真实的多退化场景下进行评估,我们引入了 Extreme Degradation Bench( EDB):87 段严重声学条件下捕获的歌唱和语音录音。在 EDB 上,SRS 在歌唱任务上超越所有开源基线,在语音任务上与商业系统持水平,尽管未进行语音特定训练。我们以 MIT 许可证发布了 SRS 和 EDB。
引用
@article{arxiv.2510.21659,
title = {Smule Renaissance Small: Efficient General-Purpose Vocal Restoration},
author = {Yongyi Zang and Chris Manchester and David Young and Ivan Ivanov and Jeffrey Lufkin and Martin Vladimirov and PJ Solomon and Svetoslav Kepchelev and Fei Yueh Chen and Dongting Cai and Teodor Naydenov and Randal Leistikow},
journal= {arXiv preprint arXiv:2510.21659},
year = {2025}
}
备注
Technical Report