利用自知识蒸馏引导帧级CTC对齐
音频与语音处理
2024-06-13 v1 计算与语言
声音
机器学习
摘要
Transformer编码器搭配连接时序分类(CTC)框架的做法在自动语音识别(ASR)中广泛应用。然而,针对ASR的知识蒸馏(KD)在帧级对齐方面存在教师-学生模型之间的不一致问题,这最终阻碍了提升学生模型性能。为解决此问题,本文引入一种自知识蒸馏(Self-Knowledge Distillation, SKD)方法,以在训练期间引导帧级对齐。与常规方法使用独立的教师和学生模型不同,本研究采用一种简单且有效的方法,共享编码器层并将子模型作为学生模型。总体而言,我们的方法在提高资源效率和性能方面都很有效。我们还对尖峰时间进行了实验分析,以说明所提方法通过减少对齐不一致性而提升了性能。
关键词
引用
@article{arxiv.2406.07909,
title = {Guiding Frame-Level CTC Alignments Using Self-knowledge Distillation},
author = {Eungbeom Kim and Hantae Kim and Kyogu Lee},
journal= {arXiv preprint arXiv:2406.07909},
year = {2024}
}
备注
Accepted by Interspeech 2024