一种用于基于 CTC 的 ASR 的上下文感知知识迁移策略
计算与语言
2022-10-13 v1 声音
音频与语音处理
摘要
非自回归自动语音识别(ASR)建模因其解码速度快且性能优越,近来受到越来越多的关注。在代表性方法中,基于连接主义时序分类(CTC)的方法仍为主流。然而,其理论固有缺陷——词元间独立性假设——为该学派工作造成了性能瓶颈。为缓解此挑战,我们提出一种由知识迁移模块与上下文感知训练策略组成的上下文感知知识迁移策略,用于基于 CTC 的 ASR。前者旨在从预训练语言模型中蒸馏语言信息,后者旨在调节由条件独立性假设带来的局限。据此,本文给出了一个构建于 wav2vec2.0 之上的知识注入型上下文感知基于 CTC 的 ASR。在 AISHELL-1 与 AISHELL-2 数据集上的一系列实验证明了所提方法的有效性。
引用
@article{arxiv.2210.06244,
title = {A context-aware knowledge transferring strategy for CTC-based ASR},
author = {Ke-Han Lu and Kuan-Yu Chen},
journal= {arXiv preprint arXiv:2210.06244},
year = {2022}
}
备注
Accepted by SLT 2022