空间语义声景分割的基线系统与评估指标
音频与语音处理
2025-06-10 v2 声音
摘要
沉浸式通信在不断取得进展,尤其是随着 Immersive Voice and Audio Services 编解码器的发布。为进一步实现这一目标,DCASE 2025 挑战最近引入了一个用于声景空间语义分割的任务(S5),该任务聚焦于检测和分离空间声景中的声音事件。在本文中,我们探讨了解决 S5 任务的方法。具体而言,我们提出了将音频标记(AT)和标签查询源分离(LSS)模型组合的 S5 基线系统。我们基于 ResUNet 架构探讨两种 LSS 方法: 提取每个检测到的事件的单个来源; 同时查询多个来源。由于 S5 中的每个分离来源都由其声音事件类别标签标识,我们提出了新的类别感知指标,用于同时评估声音来源和标签。在一阶 ambisonics 空间音频上的实验结果表明,所提出的系统有效且该指标的有效性得到确认。
引用
@article{arxiv.2503.22088,
title = {Baseline Systems and Evaluation Metrics for Spatial Semantic Segmentation of Sound Scenes},
author = {Binh Thien Nguyen and Masahiro Yasuda and Daiki Takeuchi and Daisuke Niizumi and Yasunori Ohishi and Noboru Harada},
journal= {arXiv preprint arXiv:2503.22088},
year = {2025}
}
备注
Accepted to EUSIPCO2025