用于流式多说话人语音识别的基于双标签掩码语音预测的自监督学习
音频与语音处理
2022-11-11 v1 声音
摘要
自监督学习 (SSL) 利用输入数据本身进行表示学习,已在各种下游语音任务中取得了最先进的结果。然而,以往的大多数研究集中在离线单说话人应用上,对多说话人情况的研究有限,尤其是在流式场景中。在本文中,我们研究了用于流式多说话人语音识别的 SSL,该任务以流式方式生成重叠说话人的转录。我们首先观察到,由于对重叠语音的表示不佳,传统的 SSL 技术在此任务上表现不佳。然后,我们提出了一种新的 SSL 训练目标,称为双标签掩码语音预测,它显式地保留了重叠语音中所有说话人的表示。我们研究了所提系统的各个方面,包括数据配置和量化器选择。所提出的 SSL 设置在 LibriSpeechMix 数据集上取得了显著更优的词错误率。
引用
@article{arxiv.2211.05564,
title = {Self-supervised learning with bi-label masked speech prediction for streaming multi-talker speech recognition},
author = {Zili Huang and Zhuo Chen and Naoyuki Kanda and Jian Wu and Yiming Wang and Jinyu Li and Takuya Yoshioka and Xiaofei Wang and Peidong Wang},
journal= {arXiv preprint arXiv:2211.05564},
year = {2022}
}
备注
submitted to ICASSP 2023