中文

使用活动耦合笛卡尔波达向量与 RD3net 的声事件定位与检测

音频与语音处理 2020-10-09 v2 声音

摘要

本报告描述了我们提交给 DCASE2020 任务 3:声事件定位与检测(SELD)的系统。我们考虑了两种系统:一种是同时解决声事件定位(SEL)和声事件检测(SED)的单阶段系统,另一种是先分别处理 SED 和 SEL 任务,随后合并结果的两阶段系统。作为单阶段系统,我们提出了一个统一的训练框架,使用活动耦合笛卡尔波达向量(ACCDOA)表示作为 SED 和 SEL 任务的单一目标。为了高效估计声事件的位置和活动,我们进一步提出了 RD3Net,它结合了具有密集跳跃连接和膨胀的循环层与卷积层。为了提高模型的泛化能力,我们应用了三种数据增强技术:均衡混合数据增强(EMDA)、一阶 Ambisonic(FOA)信号旋转以及 SpecAugment 的多通道扩展。我们的系统相比基线系统展现出显著的性能提升。

关键词

引用

@article{arxiv.2006.12014,
  title  = {Sound Event Localization and Detection Using Activity-Coupled Cartesian DOA Vector and RD3net},
  author = {Kazuki Shimada and Naoya Takahashi and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2006.12014},
  year   = {2020}
}

备注

Submitted to DCASE2020 task3