基于类感知置换不变信噪比的语义分割声场景评估:处理同类来源
音频与语音处理
2026-02-02 v1
摘要
为推动沉浸式通信,DCASE 2025 挑战最近引入了关于声场景空间语义分割的任务 4 (S5)。S5 系统以多通道音频混合为输入,输出单通道干源及其对应的类别标签。尽管 DCASE 2025 挑战通过限制每个混合物中的类别标签互为排他来简化该任务,但现实世界的混合物经常包含来自同一类别的多个来源。重复标签的存在会显著降低标签查询源分离 (LQSS) 模型的性能,而该模型是许多现有 S5 系统的关键组件,也会限制 DCASE 2025 任务 4 官方评估指标的有效性。为解决这些问题,我们提出了一种类感知置换不变损失函数,使 LQSS 模型能够处理涉及重复标签的查询。此外,我们重新设计了 S5 评估指标,以消除由同类来源导致的歧义。为评估所提出方法在 S5 系统中的效果,我们扩展了标签预测模型以支持同类标签。实验结果表明,所提出的方法在含同类来源和不含同类来源的混合物上都有效且稳健。
引用
@article{arxiv.2601.22504,
title = {Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources},
author = {Binh Thien Nguyen and Masahiro Yasuda and Daiki Takeuchi and Daisuke Niizumi and Noboru Harada},
journal= {arXiv preprint arXiv:2601.22504},
year = {2026}
}
备注
Accepted by ICASSP 2026