中文

基于自条件折叠编码器的非自回归 ASR

音频与语音处理 2022-02-18 v1 声音

摘要

本文提出基于 CTC 的、采用自条件折叠编码器的非自回归 ASR。所提方法通过将常规的编码器堆叠折叠为仅两个模块——基础编码器与折叠编码器——以更少参数实现非自回归 ASR。基础编码器将输入音频特征转换为适于识别的神经表示。随后重复应用折叠编码器以进一步精炼。对所有编码器输出施加 CTC 损失可强制输入输出关系的一致性。因此,折叠编码器学习执行与具有更深独立层的编码器相同的操作。在实验中,我们探究如何设置基础编码器与折叠编码器的层数及迭代次数。结果表明,所提方法仅用 38% 的参数即达到与常规方法相当的性能。此外,当增加迭代次数时,其优于常规方法。

关键词

引用

@article{arxiv.2202.08474,
  title  = {Non-Autoregressive ASR with Self-Conditioned Folded Encoders},
  author = {Tatsuya Komatsu},
  journal= {arXiv preprint arXiv:2202.08474},
  year   = {2022}
}

备注

5 pages, accepted at ICASSP2022