基于编码器级知识蒸馏的高效音频描述生成
声音
2024-07-22 v1 音频与语音处理
摘要
近期模型在自动音频描述(AAC)方面取得了显著改进。然而,随着性能的提升,这些模型变得越来越大。在这项工作中,我们提出了一种用于AAC的知识蒸馏(KD)框架。我们的分析表明,在基于编码器-解码器的AAC模型中,与解码器相比,将知识蒸馏到编码器中更为有效。为此,除了标准的监督损失和序列级KD损失外,我们还在训练中加入了编码器级KD损失。我们分别研究了两种基于均方误差(MSE)损失和对比损失的编码器级KD方法。实验结果表明,对比KD比MSE KD更鲁棒,在数据稀缺的情况下表现出优越的性能。通过在KD框架中利用纯音频数据进行训练,我们的学生模型取得了有竞争力的性能,推理速度提高了19倍。
引用
@article{arxiv.2407.14329,
title = {Efficient Audio Captioning with Encoder-Level Knowledge Distillation},
author = {Xuenan Xu and Haohe Liu and Mengyue Wu and Wenwu Wang and Mark D. Plumbley},
journal= {arXiv preprint arXiv:2407.14329},
year = {2024}
}
备注
Interspeech 2024