USTC-NERCSLIP系统用于ICMC-ASR挑战
音频与语音处理
2024-07-03 v1 声音
摘要
本报告描述了提交给车内多说话人自动语音识别(ICMC-ASR)挑战的系统,该挑战考虑到车内多说话人重叠和普通话方言动态的ASR任务。我们在前端实现了基于自监督学习表示的多说话人嵌入和基于说话人位置的波束成形。对于ASR,我们采用基于融合模型的迭代伪标签生成方法来获取非监督数据的文本标签。为缓解方言影响,提出了Accent-ASR框架,该框架在细粒度水平捕获与发音相关的方言特征,在粗粒度水平捕获语言信息。在ICMC-ASR评估集上,所提出的系统在轨道1上实现了13.16%的CER,在轨道2上实现了21.48%的cpCER,这显著优于官方基线系统,并在两个轨道上获得第一名。
引用
@article{arxiv.2407.02052,
title = {The USTC-NERCSLIP Systems for The ICMC-ASR Challenge},
author = {Minghui Wu and Luzhen Xu and Jie Zhang and Haitao Tang and Yanyan Yue and Ruizhi Liao and Jintao Zhao and Zhengzhe Zhang and Yichi Wang and Haoyin Yan and Hongliang Yu and Tongle Ma and Jiachen Liu and Chongliang Wu and Yongchao Li and Yanyong Zhang and Xin Fang and Yue Zhang},
journal= {arXiv preprint arXiv:2407.02052},
year = {2024}
}
备注
Accepted at ICASSP 2024