L3DAS23音频-视觉扩展现实挑战赛概述
音频与语音处理
2024-02-15 v1 机器学习
信号处理
摘要
ICASSP 2023的L3DAS23信号处理大挑战赛的主要目标是促进和支持关于机器学习用于3D音频信号处理的协作研究,特别强调扩展现实应用中的3D语音增强和3D声音事件定位与检测。作为我们最新竞赛的一部分,我们提供了一个全新的数据集,该数据集保持了L3DAS21和L3DAS22数据集的一般特性,但包含来自多个混响模拟环境的一阶Ambisonics录音。此外,我们开始探索音频-视觉场景,通过提供这些环境的图像,这些图像由不同的麦克风位置和方向感知。我们还为两个任务提出了更新的基线模型,这些模型现在可以支持音频-图像对作为输入,以及一个支持API来复现我们的结果。最后,我们展示了参与者的结果。有关挑战的更多详细信息,请访问https://www.l3das.com/icassp2023。
引用
@article{arxiv.2402.09245,
title = {Overview of the L3DAS23 Challenge on Audio-Visual Extended Reality},
author = {Christian Marinoni and Riccardo Fosco Gramaccioni and Changan Chen and Aurelio Uncini and Danilo Comminiello},
journal= {arXiv preprint arXiv:2402.09245},
year = {2024}
}
备注
Accepted to 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2023)