面向生成式演唱声分离模型的可靠客观评估指标
音频与语音处理
2025-11-19 v1
摘要
传统的盲源分离评估(BSS-Eval)指标最初是为评估基于时频遮罩等方法的线性音频源分离模型而设计的。然而,最近的生成模型可能在分离信号与参考信号之间引入非线性关系,限制了这些指标对客观评估的可靠性。为解决此问题,我们进行了退化类别评级听觉测试,分析了获取的退化平均意见分数(DMOS)与一组针对演唱声分离任务的客观音频质量指标之间的相关性。我们评估了三个最先进的判别模型和两个新型有竞争力的生成模型。对于判别模型和生成模型而言,基于嵌入的指标与 DMOS 的相关性高于基于时频掩模的传统侵入式指标。对于判别模型,基于 Music2Latent 嵌入的 MSE 实现了最高的相关性。当评估生成模型时,多分辨率 STFT 损失和计算在 MERT-L12 嵌入上的 MSE 显示出最强的相关性,其中后者还能在两种模型类型之间提供最均衡的相关性。我们的结果凸显了 BSS-Eval 指标在评估生成式演唱声分离模型方面的局限性,强调了为演唱声分离任务仔细选择和验证替代评估指标的必要性。
引用
@article{arxiv.2507.11427,
title = {Towards Reliable Objective Evaluation Metrics for Generative Singing Voice Separation Models},
author = {Paul A. Bereuter and Benjamin Stahl and Mark D. Plumbley and Alois Sontacchi},
journal= {arXiv preprint arXiv:2507.11427},
year = {2025}
}
备注
Accepted for presentation at the IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA 2025), 5 pages