中文

DisSR:基于退化先验引导的跨域语音修复解耦语音表示

声音 2026-02-16 v1

摘要

以往的语音修复(SR)主要聚焦于单任务语音修复(SSR),无法解决通用语音修复问题。为不同失真情况训练特定SSR模型需要大量时间且缺乏普适性。此外,大多数研究忽略了模型在未见域跨域泛化的问题。为克服这些限制,我们提出DisSR——一种基于解耦语音表示的通用语音修复模型,具有两个特性:1)退化先验引导,提取说话人不变的退化表示以指导基于扩散的语音修复模型;2)域适应,设计跨域对齐训练以分别提升模型在跨域数据上的适应性和泛化性。实验结果表明,在 various 失真条件下,我们的方法能够产生高质量的恢复语音。音频样本可在 https://itspsp.github.io/DisSR 查看。

关键词

引用

@article{arxiv.2602.12701,
  title  = {DisSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration},
  author = {Ziqi Liang and Zhijun Jia and Chang Liu and Minghui Yang and Zhihong Lu and Jian Wang},
  journal= {arXiv preprint arXiv:2602.12701},
  year   = {2026}
}

备注

Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)