中文

基于变分单调多头注意力的直接同声语音到语音翻译

计算与语言 2022-01-14 v2 声音 音频与语音处理

摘要

我们提出了一种直接同声语音到语音翻译(Simul-S2ST)模型,并且翻译的生成独立于中间文本表示。我们的方法利用了近期在基于离散单元的直接语音到语音翻译上的进展,其中模型预测一系列以无监督方式学习到的离散表示而非连续谱图特征,并直接传递给声码器以进行实时语音合成。我们还引入了变分单调多头注意力(V-MMA),以应对语音同声翻译中策略学习效率低下的问题。该同声策略随后在源语音特征与目标离散单元上运作。我们开展了实证研究,在 Fisher 西班牙语-英语和 MuST-C 英语-西班牙语数据集上比较级联方法与直接方法。结果表明,直接同声模型通过实现翻译质量与延迟之间更好的权衡,优于级联模型。

关键词

引用

@article{arxiv.2110.08250,
  title  = {Direct Simultaneous Speech-to-Speech Translation with Variational Monotonic Multihead Attention},
  author = {Xutai Ma and Hongyu Gong and Danni Liu and Ann Lee and Yun Tang and Peng-Jen Chen and Wei-Ning Hsu and Phillip Koehn and Juan Pino},
  journal= {arXiv preprint arXiv:2110.08250},
  year   = {2022}
}