基于频率加权训练损失的语音增强:面向音素级别的深度神经网络方法
声音
2025-06-24 v1 人工智能
音频与语音处理
摘要
近期深度学习技术显著提升了多通道语音增强算法的性能,但常规的训练损失函数(如不变比例信噪比,SDR)可能难以保留语音可理解性所必需的细粒度谱线索。本文提出了感知感知变体的 SDR 损失,在时频域上进行建模,并通过频率相关加权方案进行调制。这些权重旨在强调语音突出或干扰噪声尤为强烈的时频区域。我们探讨了固定权重与自适应权重策略,包括 ANSI 频段重要性权重、谱幅基准权重以及基于语音与噪声相对比例的动态权重。我们使用这些各种损失函数训练 FaSNet 多通道语音增强模型。实验结果表明,虽然标准指标如 SDR 的改进仅微乎其微,但其感知频率加权对手段则显示出更为显著的提升。此外,谱分析和音素级别分析表明,更好的共轭音重建,指向了对某些声学线索的更好保留。
引用
@article{arxiv.2506.18714,
title = {Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement},
author = {Nasser-Eddine Monir and Paul Magron and Romain Serizel},
journal= {arXiv preprint arXiv:2506.18714},
year = {2025}
}
备注
This is the preprint of the paper submitted to the 26th IEEE International Workshop on Multimedia Signal Processing (MMSP)