UniEnc-CASSNAT:一种面向语音自监督模型的仅编码器非自回归语音识别方法
音频与语音处理
2024-02-15 v1 计算与语言
声音
摘要
非自回归自动语音识别(NASR)模型因其并行性和快速推理而受到关注。基于编码器的NASR,例如连接时序分类(CTC),可以从语音基础模型(SFM)初始化,但未考虑中间标记之间的任何依赖关系。基于编码器-解码器的NASR,如基于CTC对齐的单步非自回归Transformer(CASS-NAT),可以缓解依赖问题,但无法高效集成SFM。受近期使用共享Transformer编码器进行语音-文本联合预训练工作成功的启发,我们提出了一种新的基于编码器的NASR——UniEnc-CASSNAT,以结合CTC和CASS-NAT的优势。UniEnc-CASSNAT仅由一个编码器作为主要模块,该编码器可以是SFM。该编码器通过两次前向传播,同时扮演CASS-NAT编码器和解码器的角色。编码器的第一次前向传播接受语音信号作为输入,而语音信号与token级声学嵌入的拼接则作为第二次前向传播的输入。在Librispeech 100h、MyST和Aishell1数据集上的测试表明,所提出的UniEnc-CASSNAT取得了最先进的非自回归语音识别结果,并且仅使用一个编码器,因此模型参数更少,性能优于或可比肩CASS-NAT。我们的代码已公开。
引用
@article{arxiv.2402.08898,
title = {UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models},
author = {Ruchao Fan and Natarajan Balaji Shanka and Abeer Alwan},
journal= {arXiv preprint arXiv:2402.08898},
year = {2024}
}
备注
Published in IEEE Signal Processing Letters