中文

基于频率加权训练损失的语音增强:面向音素级别的深度神经网络方法

声音 2025-06-24 v1 人工智能 音频与语音处理

摘要

近期深度学习技术显著提升了多通道语音增强算法的性能,但常规的训练损失函数(如不变比例信噪比,SDR)可能难以保留语音可理解性所必需的细粒度谱线索。本文提出了感知感知变体的 SDR 损失,在时频域上进行建模,并通过频率相关加权方案进行调制。这些权重旨在强调语音突出或干扰噪声尤为强烈的时频区域。我们探讨了固定权重与自适应权重策略,包括 ANSI 频段重要性权重、谱幅基准权重以及基于语音与噪声相对比例的动态权重。我们使用这些各种损失函数训练 FaSNet 多通道语音增强模型。实验结果表明,虽然标准指标如 SDR 的改进仅微乎其微,但其感知频率加权对手段则显示出更为显著的提升。此外,谱分析和音素级别分析表明,更好的共轭音重建,指向了对某些声学线索的更好保留。

关键词

引用

@article{arxiv.2506.18714,
  title  = {Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement},
  author = {Nasser-Eddine Monir and Paul Magron and Romain Serizel},
  journal= {arXiv preprint arXiv:2506.18714},
  year   = {2025}
}

备注

This is the preprint of the paper submitted to the 26th IEEE International Workshop on Multimedia Signal Processing (MMSP)