中文

Paraformer-v2:面向噪声鲁棒语音识别的改进型非自回归 Transformer

音频与语音处理 2024-09-27 v1 声音

摘要

基于注意力的编码器-解码器模型,如 Transformer 及其变体,以自回归(AR)方式生成输出序列。尽管其性能卓越,但 AR 模型在计算上效率较低,因为其生成需要与输出长度相同的迭代次数。本文提出 Paraformer-v2,是 Paraformer 的改进版本,用于快速、准确且抗噪声的非自回归语音识别。在 Paraformer-v2 中,我们使用 CTC 模块来提取 token 嵌入,作为 Paraformer 中连续积分-发放模块的替代方案。大量实验表明,Paraformer-v2 在多个数据集上均优于 Paraformer,尤其在英文数据集上(WER 提升超过 14%),且在噪声环境下更具鲁棒性。

关键词

引用

@article{arxiv.2409.17746,
  title  = {Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition},
  author = {Keyu An and Zerui Li and Zhifu Gao and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2409.17746},
  year   = {2024}
}

备注

NCMMSC 2024 best paper