中文

基于对比学习的个性化语音增强嵌入细化

声音 2026-01-26 v1 音频与语音处理 信号处理

摘要

个性化语音增强(Personalized Speech Enhancement, PSE)在从干扰信号中提取已知目标语音方面显示出令人信服的效果。通常情况下,这类系统会在增强系统中内置目标语音的表示,这一表示从目标语音的录音片段中通过上游模型提取。由于说话人嵌入的质量直接影响PSE性能,这些模型通常计算负担较重。然而,预先生成的嵌入无法在推理阶段考虑目标语音的变化。本文提出在说话人嵌入上进行动态细化,使用一个微型说话人编码器。我们首先引入一种新颖的对比知识蒸馏方法,以从复杂嵌入训练一个仅含15万参数的编码器。随后在增强系统中使用该编码器,证明所提方法在保持低计算负担的同时显著提升了PSE性能。

关键词

引用

@article{arxiv.2601.16235,
  title  = {Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement},
  author = {Thomas Serre and Mathieu Fontaine and Éric Benhaim and Slim Essid},
  journal= {arXiv preprint arXiv:2601.16235},
  year   = {2026}
}