中文

L3DAS23音频-视觉扩展现实挑战赛概述

音频与语音处理 2024-02-15 v1 机器学习 信号处理

摘要

ICASSP 2023的L3DAS23信号处理大挑战赛的主要目标是促进和支持关于机器学习用于3D音频信号处理的协作研究,特别强调扩展现实应用中的3D语音增强和3D声音事件定位与检测。作为我们最新竞赛的一部分,我们提供了一个全新的数据集,该数据集保持了L3DAS21和L3DAS22数据集的一般特性,但包含来自多个混响模拟环境的一阶Ambisonics录音。此外,我们开始探索音频-视觉场景,通过提供这些环境的图像,这些图像由不同的麦克风位置和方向感知。我们还为两个任务提出了更新的基线模型,这些模型现在可以支持音频-图像对作为输入,以及一个支持API来复现我们的结果。最后,我们展示了参与者的结果。有关挑战的更多详细信息,请访问https://www.l3das.com/icassp2023。

关键词

引用

@article{arxiv.2402.09245,
  title  = {Overview of the L3DAS23 Challenge on Audio-Visual Extended Reality},
  author = {Christian Marinoni and Riccardo Fosco Gramaccioni and Changan Chen and Aurelio Uncini and Danilo Comminiello},
  journal= {arXiv preprint arXiv:2402.09245},
  year   = {2024}
}

备注

Accepted to 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2023)