中文

基于空间语义分割的声景评估指标分析

声音 2026-05-27 v4

摘要

空间语义声景分割(Spatial Semantic Segmentation of Sound Scenes, S5)包括从多通道音频混合信号中联合进行音频源分离和声音事件分类。单独使用分离和分类指标来评估S5系统会使系统比较困难,而现有的联合指标,如基于类的信噪比失真率(class-aware signal-to-distortion ratio, CA-SDR),可能会混淆分离误差和标签误差。特别是,CA-SDR依赖于预测的类别标签进行源匹配,这可能在底层源估计仍然感官上正确的情况下掩盖标签交换或误分类。本文引入了基于类和源的信噪比失真率(class and source-aware signal-to-distortion ratio, CASA-SDR)这一新指标,通过在计算分类误差前进行置换不变的源匹配,从而从分类导向的方法转向分离导向的方法。我们首先在受控场景下分析CA-SDR,该场景包括使用oracle分离和合成分类误差,以及受控的源之间交叉污染情况,并将其行为与经典SDR和CASA-SDR进行比较。我们还通过引入基于误差的聚合策略和基于源的聚合策略来研究分类误差对指标的影响。最后,我们在DCASE 2025挑战任务4提交的系统上对CA-SDR和CASA-SDR进行比较,突出了CA-SDR在标签交换或分离不良的源上会过度惩罚的情况,而CASA-SDR提供了更具可解释性的S5性能分离中心评估。

关键词

引用

@article{arxiv.2511.07075,
  title  = {Metric Analysis for Spatial Semantic Segmentation of Sound Scenes},
  author = {Mayank Mishra and Paul Magron and Romain Serizel},
  journal= {arXiv preprint arXiv:2511.07075},
  year   = {2026}
}

备注

5 pages; content+bibliography