基于掩码自蒸馏 Transducer 并采用半自回归解码的语音关键词 spotting
声音
2025-06-02 v1 音频与语音处理
摘要
基于 RNN-T 的采用自回归解码 (AR) 的关键词 spotting (KWS) 因其流式架构和卓越性能而备受关注。然而,RNN-T 中预测网络的简单性带来了过拟合问题,尤其是在具有挑战性的场景下,会导致性能下降。在本文中,我们提出了一种掩码自蒸馏 (MSD) 训练策略,避免 RNN-T 过度依赖预测网络以缓解过拟合。这种训练实现了掩码非自回归 (NAR) 解码,在 KWS 解码期间完全掩码 RNN-T 预测器的输出。此外,我们提出了一种半自回归 (SAR) 解码方法,以整合 AR 和 NAR 解码的优势。我们在多个 KWS 数据集上的实验表明,MSD 训练有效缓解了过拟合。SAR 解码方法保留了 AR 解码的卓越性能,同时受益于 NAR 解码对过拟合的抑制,取得了优异的结果。
引用
@article{arxiv.2505.24820,
title = {Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding},
author = {Yu Xi and Xiaoyu Gu and Haoyu Li and Jun Song and Bo Zheng and Kai Yu},
journal= {arXiv preprint arXiv:2505.24820},
year = {2025}
}