中文

SLICE:通过层级注入条件嵌入进行语音增强

声音 2026-03-06 v1

摘要

现实语音常同时受到多种退化干扰,包括叠加噪声、混响和非线性失真。基于扩散的增强方法在单一退化上表现良好,但在复合退化方面仍存在挑战。已有的噪声感知方法仅在输入层注入条件,可能导致性能低于无条件模型。为此,我们提出将来自预训练编码器的条件注入(该编码器拥有针对噪声类型、混响和失真的多任务头)注入到时间步嵌入中,从而在无需架构修改的情况下通过所有残差块传播。我们在受控实验中仅变化注入方法,输入层条件注入在复合退化下性能低于无编码器,而层级注入 achieves 最佳效果。该方法还能很好地推广到多样化的真实录音场景。

关键词

引用

@article{arxiv.2603.05302,
  title  = {SLICE: Speech Enhancement via Layer-wise Injection of Conditioning Embeddings},
  author = {Seokhoon Moon and Kyudan Jung and Jaegul Choo},
  journal= {arXiv preprint arXiv:2603.05302},
  year   = {2026}
}

备注

5 pages, 1 figure, 4 tables, submitted to INTERSPEECH 2026