提高立体声 3D 声音事件定位与检测: 感知特征、立体声专用数据增强与距离归一化
音频与语音处理
2025-07-02 v1
摘要
本技术报告是我们提交给 DCASE 2025 挑战任务 3:正规视频内容下的立体声声音事件定位与检测( SELD) 的作品。我们针对音频-only 任务作了报告,并引入若干关键贡献: 首先,我们设计了感知动机的输入特征,以提高事件检测、声源定位和距离估计效果。其次,我们针对立体声音频的特殊性,采用包括通道交换和时频掩码在内的增强策略。我们还引入尚未用于 SELD 工作的 FilterAugment 技术。最后,我们在训练期间应用距离归一化方法,以稳定回归目标。在 stereo STARSS23 数据集上进行的实验表明,所有 SELD 指标均实现了一致的性能提升。可在本存储库中复制我们的工作: https://github.com/itsjunwei/NTU_SNTL_Task3
引用
@article{arxiv.2507.00874,
title = {Improving Stereo 3D Sound Event Localization and Detection: Perceptual Features, Stereo-specific Data Augmentation, and Distance Normalization},
author = {Jun-Wei Yeow and Ee-Leng Tan and Santi Peksi and Woon-Seng Gan},
journal= {arXiv preprint arXiv:2507.00874},
year = {2025}
}
备注
Technical report for DCASE 2025 Challenge Task 3