中文

面向车载多通道语音识别挑战赛的 RoyalFlush 自动语音说话人日志与识别系统

声音 2024-05-10 v1 音频与语音处理

摘要

本文介绍了我们为车载多通道自动语音识别(ICMC-ASR)挑战赛提交的系统,该挑战赛专注于复杂多说话人场景中的说话人日志和语音识别。为了应对这些挑战,我们开发了端到端说话人日志模型,与开发集上的官方基线相比,该模型显著降低了说话人日志错误率(DER)达 49.58\%。在语音识别方面,我们利用自监督学习表示来训练端到端 ASR 模型。通过集成这些模型,我们在 track 1 评估集上实现了 16.93\% 的字符错误率(CER),在 track 2 评估集上实现了 25.88\% 的拼接最小排列字符错误率。

关键词

引用

@article{arxiv.2405.05498,
  title  = {The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge},
  author = {Jingguang Tian and Shuaishuai Ye and Shunfei Chen and Yang Xiang and Zhaohui Yin and Xinhui Hu and Xinkang Xu},
  journal= {arXiv preprint arXiv:2405.05498},
  year   = {2024}
}