中文

利用同声传译数据训练带风格标签的端到端同声语音翻译模型

计算与语言 2023-06-16 v1 声音 音频与语音处理

摘要

同声语音翻译(SimulST)对部分语音输入进行增量式翻译。尽管输入与输出之间的单调对应有利于降低延迟,但对于英语和日语等远距离语言对而言并非如此。解决该问题的一个可行方法是利用同声传译(SI)数据来模仿同声传译以训练 SimulST 模型。然而,此类 SI 数据规模有限,因此应将 SI 数据与提供离线译文的常规双语数据结合使用。本文中,我们提出了一种利用 SI 与离线混合数据训练 SimulST 模型的有效方法。所提方法使用带有风格标签的混合数据训练单一模型,该标签告知模型生成 SI 风格或离线风格的译文。实验结果显示在不同延迟区间内 BLEURT 均有提升,且我们的分析表明所提模型比基线生成更多 SI 风格的输出。

关键词

引用

@article{arxiv.2306.08582,
  title  = {Tagged End-to-End Simultaneous Speech Translation Training using Simultaneous Interpretation Data},
  author = {Yuka Ko and Ryo Fukuda and Yuta Nishikawa and Yasumasa Kano and Katsuhito Sudoh and Satoshi Nakamura},
  journal= {arXiv preprint arXiv:2306.08582},
  year   = {2023}
}

备注

Accepted to IWSLT2023 scientific paper