SA-Paraformer:非自回归端到端说话人属性语音识别
声音
2023-10-10 v1 音频与语音处理
摘要
多说话人 ASR 与说话人日记化的联合建模近期在说话人属性自动语音识别(SA-ASR)中显示出有前景的结果。尽管能够获得最先进(SOTA)性能,大多数研究基于自回归(AR)解码器,其逐个生成词元并导致较大的实时因子(RTF)。为加速推理,我们引入最近提出的非自回归模型 Paraformer 作为 SA-ASR 模型中的声学模型。Paraformer 使用单步解码器实现并行生成,获得与 SOTA AR Transformer 模型相当的性能。此外,我们提出说话人填充策略以减少说话人识别错误,并采用 inter-CTC 策略增强编码器在声学建模中的能力。在 AliMeeting 语料库上的实验表明,我们的模型在测试集上以 6.1% 的相对说话人相关字符错误率(SD-CER)降低优于级联 SA-ASR 模型。此外,我们的模型实现了 34.8% 的可比 SD-CER,而 RTF 仅为 SOTA 联合 AR SA-ASR 模型的 1/10。
引用
@article{arxiv.2310.04863,
title = {SA-Paraformer: Non-autoregressive End-to-End Speaker-Attributed ASR},
author = {Yangze Li and Fan Yu and Yuhao Liang and Pengcheng Guo and Mohan Shi and Zhihao Du and Shiliang Zhang and Lei Xie},
journal= {arXiv preprint arXiv:2310.04863},
year = {2023}
}