真实 360 度视听声景中增强的声音事件定位与检测
声音
2024-01-31 v1 人工智能
音频与语音处理
摘要
本技术报告详细介绍了我们构建增强型视听声音事件定位与检测(SELD)网络的工作。我们在纯音频 SELDnet23 模型的基础上进行构建,通过在纯音频网络的门控循环单元(GRU)之前融合音频和视频信息,将其改造为视听模型。我们的模型利用了 YOLO 和 DETIC 目标检测器。我们还构建了一个实现视听数据增强和视听合成数据生成的框架。我们交付了一个性能优于现有视听 SELD 基线的视听 SELDnet 系统。
引用
@article{arxiv.2401.17129,
title = {Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes},
author = {Adrian S. Roman and Baladithya Balamurugan and Rithik Pothuganti},
journal= {arXiv preprint arXiv:2401.17129},
year = {2024}
}