中文

SELD-TCN:基于时间卷积网络的声事件定位与检测

音频与语音处理 2021-01-13 v1 机器学习 声音 机器学习

摘要

对周围环境的理解在自动驾驶汽车等自主机器人系统中起着关键作用。关于视觉感知已开展广泛研究。然而,为获得更完整的环境感知,未来自主系统也应考虑声学信息。近期的声事件定位与检测(SELD)框架利用卷积循环神经网络(CRNNs)。但考虑到 CRNNs 的循环特性,将其高效部署于嵌入式硬件颇具挑战。其计算不仅难以并行化,还需高内存带宽和大内存缓冲。本工作中,我们基于时间卷积网络(TCN)开发了更鲁棒且硬件友好的新颖架构。所提框架(SELD-TCN)在四个不同数据集上优于最先进的(state-of-the-art, SOTA)SELDnet 性能。此外,SELD-TCN 在普通图形处理单元(GPU)上实现了每轮训练时间快 4 倍、推理时间快 40 倍。

关键词

引用

@article{arxiv.2003.01609,
  title  = {SELD-TCN: Sound Event Localization & Detection via Temporal Convolutional Networks},
  author = {Karim Guirguis and Christoph Schorn and Andre Guntoro and Sherif Abdulatif and Bin Yang},
  journal= {arXiv preprint arXiv:2003.01609},
  year   = {2021}
}

备注

5 pages, 3 tables, 2 figures. Submitted to EUSIPCO 2020