中文

空间混叠:作为声音事件定位与检测数据增强的指向性响度修改

音频与语音处理 2022-05-20 v1 机器学习 声音

摘要

数据增强方法在标注数据稀缺或获取成本高的各类监督学习问题中已显现出极大重要性。针对声音事件定位与检测(SELD)任务,已有若干增强方法被提出,其中多数借用了图像、语音或单声道音频等其他领域的思路。然而,仅有少数利用了完整 3D 音频场景的空间特性。我们提出空间混叠(Spatial Mixup),作为参数化空间音频效果用于数据增强的一种应用,其修改以 ambisonics 域编码的多通道空间音频信号的指向性属性。类似于波束成形,这些修改增强或抑制来自特定方向的信号,尽管效果较不显著。因此使深度学习模型实现对微小空间扰动的不变性。该方法在 DCASE 2021 Task 3 数据集上通过实验评估,空间混叠相较非增强基线提升了性能,并与其他知名增强方法具有可比性。此外,将空间混叠与其他方法结合可大幅改善性能。

关键词

引用

@article{arxiv.2110.06126,
  title  = {Spatial mixup: Directional loudness modification as data augmentation for sound event localization and detection},
  author = {Ricardo Falcon-Perez and Kazuki Shimada and Yuichiro Koyama and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2110.06126},
  year   = {2022}
}

备注

5 pages, 2 figures, 4 tables. Submitted to the 2022 International Conference on Acoustics, Speech, & Signal Processing (ICASSP)