NOTSOFAR-1 挑战概述:亮点与学习经验
声音
2025-03-11 v2 机器学习
音频与语音处理
摘要
首个 Natural Office Talkers in Settings of Far-field Audio Recordings (NOTSOFAR-1) 挑战是一个关键性举措,通过提供比以前可用数据更能代表实际商业应用需求的数据,树立了新的基准。该挑战独特地提供了 280 场录制的会议,覆盖 30 个多样化环境,捕捉真实的声学条件和对话动态,以及 1000 小时的模拟训练数据,通过增强真实性来实现对真实情境的泛化,包含 15000 个真实声学传递函数。在本文中,我们提供了提交给该挑战的系统概览,分析了表现最佳的方法,假设其成功背后的因素。此外,我们突出了参赛者未能探索的有前景的方向。通过呈现关键发现和可操作见解,本工作旨在推动 DASR 研究及其应用的进一步创新和进步。
引用
@article{arxiv.2501.17304,
title = {Summary of the NOTSOFAR-1 Challenge: Highlights and Learnings},
author = {Igor Abramovski and Alon Vinnikov and Shalev Shaer and Naoyuki Kanda and Xiaofei Wang and Amir Ivry and Eyal Krupka},
journal= {arXiv preprint arXiv:2501.17304},
year = {2025}
}