中文

基于帧级准则的轻量级转换器

计算与语言 2024-11-04 v2 声音 音频与语音处理

摘要

基于序列级准则训练的转换器模型会产生大型概率矩阵,导致内存需求大。我们提出一种基于帧级准则的轻量级转换器模型,该模型使用 CTC 强制对齐算法的结果来确定每个帧的标签。随后,编码器输出可在相应时间与解码器输出组合,而非如转换器中那样将编码器的每个元素输出加到解码器的每个元素输出上。这显著降低了内存和计算要求。为解决标签中空白过多导致分类不平衡的问题,我们将空白概率与非空白概率解耦,并对空白分类器的梯度在主网络中进行截断。在 AISHELL-1 数据集上实验表明,此方法使轻量级转换器能够达到与转换器相似的性能。此外,我们利用更丰富的信息预测空白概率,效果优于转换器。

关键词

引用

@article{arxiv.2409.13698,
  title  = {Lightweight Transducer Based on Frame-Level Criterion},
  author = {Genshun Wan and Mengzhi Wang and Tingzhi Mao and Hang Chen and Zhongfu Ye},
  journal= {arXiv preprint arXiv:2409.13698},
  year   = {2024}
}

备注

Accepted by Interspeech 2024, code repository: https://github.com/wangmengzhi/Lightweight-Transducer