L3DAS21 挑战赛:面向三维音频信号处理的机器学习
音频与语音处理
2022-12-16 v3 机器学习
声音
信号处理
摘要
L3DAS21 挑战赛旨在鼓励并促进关于三维音频信号处理的机器学习协作研究,特别关注三维语音增强(SE)与三维声音定位与检测(SELD)。随挑战赛一同发布的是 L3DAS21 数据集,一个 65 小时的三维音频语料库,并配有便于数据使用和结果提交阶段的 Python API。通常,针对三维音频任务的机器学习方法基于单视角 Ambisonics 录音或单振膜麦克风阵列。我们转而提出一种基于多源多视角 Ambisonics 录音的新型多通道音频配置,由一对一阶 Ambisonics 麦克风阵列实现。据我们所知,这是首次将双麦克风 Ambisonics 配置用于这些任务。我们为两项任务提供了使用最先进架构获得的基线模型与结果:用于 SE 的 FaSNet 和用于 SELD 的 SELDNet。本报告旨在提供参与 L3DAS21 挑战赛所需的全部信息,阐明 L3DAS21 数据集、挑战赛任务及基线模型的细节。
引用
@article{arxiv.2104.05499,
title = {L3DAS21 Challenge: Machine Learning for 3D Audio Signal Processing},
author = {Eric Guizzo and Riccardo F. Gramaccioni and Saeid Jamili and Christian Marinoni and Edoardo Massaro and Claudia Medaglia and Giuseppe Nachira and Leonardo Nucciarelli and Ludovica Paglialunga and Marco Pennese and Sveva Pepe and Enrico Rocchi and Aurelio Uncini and Danilo Comminiello},
journal= {arXiv preprint arXiv:2104.05499},
year = {2022}
}
备注
Documentation paper for the L3DAS21 Challenge for IEEE MLSP 2021. Further information on www.l3das.com/mlsp2021