中文

利用自知识蒸馏引导帧级CTC对齐

音频与语音处理 2024-06-13 v1 计算与语言 声音 机器学习

摘要

Transformer编码器搭配连接时序分类(CTC)框架的做法在自动语音识别(ASR)中广泛应用。然而,针对ASR的知识蒸馏(KD)在帧级对齐方面存在教师-学生模型之间的不一致问题,这最终阻碍了提升学生模型性能。为解决此问题,本文引入一种自知识蒸馏(Self-Knowledge Distillation, SKD)方法,以在训练期间引导帧级对齐。与常规方法使用独立的教师和学生模型不同,本研究采用一种简单且有效的方法,共享编码器层并将子模型作为学生模型。总体而言,我们的方法在提高资源效率和性能方面都很有效。我们还对尖峰时间进行了实验分析,以说明所提方法通过减少对齐不一致性而提升了性能。

关键词

引用

@article{arxiv.2406.07909,
  title  = {Guiding Frame-Level CTC Alignments Using Self-knowledge Distillation},
  author = {Eungbeom Kim and Hantae Kim and Kyogu Lee},
  journal= {arXiv preprint arXiv:2406.07909},
  year   = {2024}
}

备注

Accepted by Interspeech 2024