中文

LongFNT:基于因子化神经转导器的长语音识别

声音 2022-11-18 v1 计算与语言 音频与语音处理

摘要

传统自动语音识别(ASR)系统通常聚焦于单条语音,未考虑带有有用历史信息的长语音,而后者在实际场景中更为实用。在初步实验中,简单地为朴素神经转导器模型关注更长的转写历史并未带来明显增益,因为预测网络并非纯语言模型。这促使我们利用因子化神经转导器结构,其包含一个真实语言模型——词汇预测器。我们提出了{LongFNT-Text}架构,将句子级长语音特征直接与词汇预测器输出融合,并将词级长语音特征嵌入词汇预测器内部,使用预训练上下文编码器RoBERTa进一步提升性能。此外,我们通过将长语音扩展至原始语音输入提出{LongFNT}架构,取得了最佳性能。我们的LongFNT方法的有效性在LibriSpeech和GigaSpeech语料库上得到验证,相对词错误率(WER)分别降低19%和12%。

关键词

引用

@article{arxiv.2211.09412,
  title  = {LongFNT: Long-form Speech Recognition with Factorized Neural Transducer},
  author = {Xun Gong and Yu Wu and Jinyu Li and Shujie Liu and Rui Zhao and Xie Chen and Yanmin Qian},
  journal= {arXiv preprint arXiv:2211.09412},
  year   = {2022}
}

备注

Submitted to ICASSP2023