中文

通过离散语音单元预训练实现紧凑型语音翻译模型

计算与语言 2024-06-27 v2 声音 音频与语音处理

摘要

我们提出一种预训练方法,利用自监督语音(SSS)模型来构建更紧凑的语音到文本翻译模型。与使用SSS模型进行初始化不同,我们的方法更适合内存受限的场景,例如设备端部署。我们的方法基于从SSS模型中提取的离散语音单元(DSU)。第一步,我们的方法在两个较小的编码器-解码器模型上分别预训练:1)滤波器组到DSU(Fbk-to-DSU)和2)DSU到翻译(DSU-to-Trl)数据。因此,DSU成为较小模型的蒸馏输入。随后,来自Fbk-to-DSU模型的编码器和来自DSU-to-Trl模型的解码器被用于初始化紧凑模型。最后,紧凑模型在配对的Fbk-Trl数据上进行微调。除了紧凑性之外,我们的方法不需要转录文本,因此适用于低资源场景。它还避免了推理中的语音离散化,并且对DSU分词更具鲁棒性。在CoVoST-2(X-En)上的评估表明,我们的方法在三个指标上相较于基线有一致的改进,同时保持紧凑,即仅为SSS模型大小的一半。

关键词

引用

@article{arxiv.2402.19333,
  title  = {Compact Speech Translation Models via Discrete Speech Units Pretraining},
  author = {Tsz Kin Lam and Alexandra Birch and Barry Haddow},
  journal= {arXiv preprint arXiv:2402.19333},
  year   = {2024}
}

备注

11 pages, accepted at IWSLT 2024