CHiME-8 DASR 挑战:面向通用且数组无关的遥远自动语音识别与说话人分割
音频与语音处理
2024-07-24 v1 声音
摘要
本文介绍了 CHiME-8 DASR 挑战, 继前一版本 CHiME-7 DASR (C7DASR) 以及历届 CHiME-6 挑战之后的进展。 挑战聚焦于联合多通道遥远语音识别 (DASR) 与说话人分割任务, 可使用一个或多个可能异构的设备。 主要目标是推动研究, 以开发能够在任意说话人数、不同场景(正式场合与非正式对话)、会议时长、各种声学情境以及不同录音配置之间泛化的转录方法。 相较于 C7DASR, 本次挑战的新颖之处包括: i) 增加了 NOTSOFAR-1 场景, 该场景为办公/企业会议情境; ii) 人工校正的 Mixer 6 开发数据集; iii) 新增一个允许使用大型语言模型 (LLM) 的赛道; iv) 引入评委奖励机制,以鼓励参赛者探索更具实用性和创新性的解决方案。 为降低参赛者的进入门槛,我们提供了独立的工具箱,用于下载和准备数据集、执行文本规范化以及对提交结果进行评分。 此外,今年我们还提供了两个基线系统, 一个直接继承自 C7DASR 基于 ESPnet, 另一个基于 NeMo 的系统, 源自去年 C7DASR NeMo 团队的提交。 基线系统结果表明, NOTSOFAR-1 场景的加入显著增加了任务难度, 其高说话人数和极短时长是主要原因。
引用
@article{arxiv.2407.16447,
title = {The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization},
author = {Samuele Cornell and Taejin Park and Steve Huang and Christoph Boeddeker and Xuankai Chang and Matthew Maciejewski and Matthew Wiesner and Paola Garcia and Shinji Watanabe},
journal= {arXiv preprint arXiv:2407.16447},
year = {2024}
}