中文

Loud-loss:基于等响轮廓的语音增强感知主导损失函数

声音 2025-11-11 v1

摘要

均方误差(MSE)是语音增强中常见的损失函数,但其问题在于误差无法反映听觉感知质量。这是因为 MSE 会导致模型过度关注能量较大的低频分量,从而在感知上关键的高频信息建模不足。为克服这一局限,我们提出一种基于精神听觉原理的感知加权损失函数。具体而言,该方法利用等响轮廓对重建误差进行频率相关加权,从而以符合人类听觉灵敏度的方式惩罚误差。该损失函数与模型无关且灵活,具有强大的普适性。在 VoiceBank+DEMAND 数据集上的实验表明,将 MSE 替换为本文提出的损失函数后,GTCRN 模型的 WB-PESQ 分数从 2.17 提升至 2.93,显著提升了感知质量。

关键词

引用

@article{arxiv.2511.05945,
  title  = {Loud-loss: A Perceptually Motivated Loss Function for Speech Enhancement Based on Equal-Loudness Contours},
  author = {Zixuan Li and Xueliang Zhang and Changjiang Zhao and Shuai Gao and Lei Miao and Zhipeng Yan and Ying Sun and Chong Zhu},
  journal= {arXiv preprint arXiv:2511.05945},
  year   = {2025}
}