用于端到端语音翻译的解耦非参数知识蒸馏
计算与语言
2023-04-21 v1 声音
音频与语音处理
摘要
现有技术常试图通过一些精细的技巧将强大的机器翻译(MT)模型的知识迁移到语音翻译(ST)模型中,这通常在训练时需要转写文本作为额外输入。然而,转写文本并非总是可得,且如何在不使用转写文本的情况下提升 ST 模型性能,即数据效率,在文献中鲜有研究。本文中,我们从数据视角提出解耦非参数知识蒸馏(DNKD)以提升数据效率。我们的方法遵循知识蒸馏范式。然而,我们并非从复杂的 MT 模型获取教师分布,而是通过 k 近邻(kNN)检索从非参数数据存储中构建该分布,从而去除对转写文本和 MT 模型的依赖。随后我们将经典知识蒸馏损失解耦为目标蒸馏与非目标蒸馏,以增强非目标 logits 中知识的作用,即显著的“暗知识”。在 MuST-C 语料上的实验表明,所提方法能在不依赖任何转写文本的情况下相较强基线取得一致提升。
引用
@article{arxiv.2304.10295,
title = {Decouple Non-parametric Knowledge Distillation For End-to-end Speech Translation},
author = {Hao Zhang and Nianwen Si and Yaqi Chen and Wenlin Zhang and Xukui Yang and Dan Qu and Zhen Li},
journal= {arXiv preprint arXiv:2304.10295},
year = {2023}
}
备注
Accepted by ICASSP 2023