DisSR:基于退化先验引导的跨域语音修复解耦语音表示
声音
2026-02-16 v1
摘要
以往的语音修复(SR)主要聚焦于单任务语音修复(SSR),无法解决通用语音修复问题。为不同失真情况训练特定SSR模型需要大量时间且缺乏普适性。此外,大多数研究忽略了模型在未见域跨域泛化的问题。为克服这些限制,我们提出DisSR——一种基于解耦语音表示的通用语音修复模型,具有两个特性:1)退化先验引导,提取说话人不变的退化表示以指导基于扩散的语音修复模型;2)域适应,设计跨域对齐训练以分别提升模型在跨域数据上的适应性和泛化性。实验结果表明,在 various 失真条件下,我们的方法能够产生高质量的恢复语音。音频样本可在 https://itspsp.github.io/DisSR 查看。
引用
@article{arxiv.2602.12701,
title = {DisSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration},
author = {Ziqi Liang and Zhijun Jia and Chang Liu and Minghui Yang and Zhihong Lu and Jian Wang},
journal= {arXiv preprint arXiv:2602.12701},
year = {2026}
}
备注
Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)