NOTSOFAR-1 挑战赛:面向远场会议转录的新数据集、基线系统与任务
声音
2024-01-18 v1 人工智能
计算与语言
音频与语音处理
摘要
我们推出首届“远场音频录音场景下的自然办公室说话人”(NOTSOFAR-1)挑战赛,并同时发布相关数据集与基线系统。该挑战赛聚焦于远场会议场景中的远距离说话人日志与自动语音识别(DASR),设有单通道和已知几何布局的多通道赛道,并作为两个新数据集的发布平台:其一为基准数据集,包含 315 场会议,平均时长 6 分钟,涵盖广泛的真实声学条件与会话动态,在 30 间会议室录制,每场 4-8 名与会者,共 35 位不同说话人;其二为 1000 小时模拟训练数据集,为增强真实世界泛化能力而合成,具有更高的逼真度,并纳入了 15000 个真实声学传递函数。任务聚焦于单设备 DASR,其中多通道设备始终共享相同的已知几何布局。这与实际会议室中的常见配置一致,避免了多设备任务带来的技术复杂性,同时也允许开发针对特定几何布局的解决方案。NOTSOFAR-1 挑战赛旨在推动远场对话语音识别领域的研究,提供关键资源以释放数据驱动方法的潜力,我们认为这些方法目前因缺乏全面的高质量训练与基准数据集而受到制约。
引用
@article{arxiv.2401.08887,
title = {NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription},
author = {Alon Vinnikov and Amir Ivry and Aviv Hurvitz and Igor Abramovski and Sharon Koubi and Ilya Gurvich and Shai Pe`er and Xiong Xiao and Benjamin Martinez Elizalde and Naoyuki Kanda and Xiaofei Wang and Shalev Shaer and Stav Yagev and Yossi Asher and Sunit Sivasankaran and Yifan Gong and Min Tang and Huaming Wang and Eyal Krupka},
journal= {arXiv preprint arXiv:2401.08887},
year = {2024}
}
备注
preprint