中文

USTC-NERCSLIP 系统用于 CHiME-8 NOTSOFAR-1 挑战

音频与语音处理 2024-10-25 v2 声音

摘要

本技术报告概述了我们为 CHiME-8 NOTSOFAR-1 挑战提交的系统。此挑战的主要难点在于该数据集在各种会议室中录制,捕获了包括高重叠率、背景噪声、说话人数目可变以及自然对话风格在内的真实世界复杂性。为解决这些问题,我们在多个方面对系统进行了优化:对于前端语音信号处理,我们引入了面向分割和分离的联合训练方法(JDS),以增强音频质量。此外,我们还集成了传统的引导源分离(GSS)用于多通道轨道,以为 JDS 提供补充信息。对于后端语音识别,我们通过引入 WavLM、ConvNeXt 和 Transformer 的创新,应用多任务训练和 Noise KLD 数据增强,显著提升了 ASR 的鲁棒性和准确度。我们的系统在 CHiME-8 NOTSOFAR-1 Dev-set-2 多通道和单通道轨道上分别实现了时间受限最小置换词错误率(tcpWER)为 14.265% 和 22.989%。

关键词

引用

@article{arxiv.2409.02041,
  title  = {The USTC-NERCSLIP Systems for the CHiME-8 NOTSOFAR-1 Challenge},
  author = {Shutong Niu and Ruoyu Wang and Jun Du and Gaobin Yang and Yanhui Tu and Siyuan Wu and Shuangqing Qian and Huaxin Wu and Haitao Xu and Xueyang Zhang and Guolong Zhong and Xindi Yu and Jieru Chen and Mengzhi Wang and Di Cai and Tian Gao and Genshun Wan and Feng Ma and Jia Pan and Jianqing Gao},
  journal= {arXiv preprint arXiv:2409.02041},
  year   = {2024}
}