用于端到端语音翻译的源端与目标端双向知识蒸馏
计算与语言
2021-04-15 v1 声音
音频与语音处理
摘要
改进端到端语音翻译(E2E-ST)模型性能的一种常规方法是通过与自动语音识别(ASR)和神经机器翻译(NMT)任务进行预训练和联合训练来利用源语言转写文本。然而,由于输入模态不同,难以成功利用源语言文本。在本工作中,我们关注来自基于文本的外部 NMT 模型的序列级知识蒸馏(SeqKD)。为充分利用源语言信息的潜力,我们提出了反向 SeqKD,即来自目标到源反向 NMT 模型的知识蒸馏。为此,我们训练一个双语 E2E-ST 模型,以单个解码器将改写后的转写文本作为辅助任务进行预测。这些改写文本由双语语料中的翻译通过反向翻译生成。我们进一步提出了双向 SeqKD,将来自正向和反向 NMT 模型的知识蒸馏相结合。在自回归和非自回归模型上的实验评估表明,每个方向的知识蒸馏都持续提升翻译性能,且无论模型容量如何,其有效性都是互补的。
引用
@article{arxiv.2104.06457,
title = {Source and Target Bidirectional Knowledge Distillation for End-to-end Speech Translation},
author = {Hirofumi Inaguma and Tatsuya Kawahara and Shinji Watanabe},
journal= {arXiv preprint arXiv:2104.06457},
year = {2021}
}
备注
Accepted at NAACL-HLT 2021 (short paper)