中文

面向 ICASSP 2022 多通道多方会议转录挑战赛的 Volcspeech 系统

声音 2022-02-11 v2 人工智能 音频与语音处理

摘要

本文描述我们提交至 ICASSP 2022 多通道多方会议转录(M2MeT)挑战赛的方案。对于赛道 1,我们提出若干方法以增强基于聚类的说话人日志系统处理重叠语音的能力。前端去混响与到达方向(DOA)估计用于提升说话人日志准确性。多通道组合与重叠检测用于降低漏检说话人错误。还提出一种改进的 DOVER-Lap 以融合不同系统结果。我们在 Eval 集与 Test 集上分别取得最终 DER 5.79% 与 7.23%。对于赛道 2,我们采用联合 CTC-注意力架构中的 Conformer 模型开发系统。采用序列化输出训练于多说话人重叠语音识别。提出神经前端模块建模多通道音频并端到端训练模型。利用多种数据增强方法缓解多通道多说话人 E2E 系统的过拟合。开发 Transformer 语言模型融合以获得更优性能。最终 CER 在 Eval 集为 19.2%,Test 集为 20.8%。

关键词

引用

@article{arxiv.2202.04261,
  title  = {The Volcspeech system for the ICASSP 2022 multi-channel multi-party meeting transcription challenge},
  author = {Chen Shen and Yi Liu and Wenzhi Fan and Bin Wang and Shixue Wen and Yao Tian and Jun Zhang and Jingsheng Yang and Zejun Ma},
  journal= {arXiv preprint arXiv:2202.04261},
  year   = {2022}
}