中文

利用未来感知蒸馏与推理将离线语音翻译模型适配于流式处理

计算与语言 2023-10-27 v2

摘要

流式语音翻译的一种流行方法是采用单一离线模型配合wait-k策略以支持不同的延迟要求,这比训练多个具有不同延迟约束的在线模型更为简单。然而,在使用以完整语句训练的模型对部分输入进行流式推理时,存在不匹配问题。我们证明,在流式输入末尾提取的语音表征与从完整语句提取的表征显著不同。为解决此问题,我们提出一种称为未来感知流式翻译(Future-Aware Streaming Translation, FAST)的新方法,将离线语音翻译(ST)模型适配于流式输入。FAST包含一种未来感知推理(Future-Aware Inference, FAI)策略,其通过可训练的掩码嵌入引入未来上下文;以及一种未来感知蒸馏(Future-Aware Distillation, FAD)框架,将未来上下文从完整语音的近似迁移到流式输入。我们在MuST-C EnDe、EnEs和EnFr基准上的实验表明,FAST比强基线在翻译质量与延迟之间取得了更好的权衡。大量分析表明,我们的方法有效缓解了上述离线训练与在线推理之间的不匹配问题。

关键词

引用

@article{arxiv.2303.07914,
  title  = {Adapting Offline Speech Translation Models for Streaming with Future-Aware Distillation and Inference},
  author = {Biao Fu and Minpeng Liao and Kai Fan and Zhongqiang Huang and Boxing Chen and Yidong Chen and Xiaodong Shi},
  journal= {arXiv preprint arXiv:2303.07914},
  year   = {2023}
}

备注

Accept to EMNLP 2023 main conference