中文

基于自监督语音表征的语音增强模型位置不变微调

计算与语言 2026-01-30 v1 声音 音频与语音处理

摘要

将前端语音增强(SE)模型与自监督学习(SSL)基语音模型集成是噪声环境下下游任务中有效的方法。SE模型通常使用SSL表征进行微调,采用增强语音与干净语音之间的均方误差(MSE)损失。然而,MSE损失容易利用SSL模型中的位置嵌入,允许通过位置相关性来最小化目标,而非内容相关信息。本工作将问题表述为自监督表征微调的通用局限性,并通过基于表征引导的SE进行探讨。考虑两种策略:(1)零填充,在SSL预训练中曾被探索,但本文在微调设置中进行检验;(2)基于软-DTW损失的速度扰动。实验表明,基于软-DTW的方法实现了更快的收敛和改进的下游性能,凸显了SSL基语音建模中位置不变微调的重要性。

关键词

引用

@article{arxiv.2601.21084,
  title  = {Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations},
  author = {Amit Meghanani and Thomas Hain},
  journal= {arXiv preprint arXiv:2601.21084},
  year   = {2026}
}

备注

Accepted to ICASSP 2026