DiffS2UT:一种用于无文本直接语音到语音翻译的语义保持扩散模型
计算与语言
2023-10-27 v1
摘要
尽管扩散生成模型在图像生成任务上取得了巨大成功,如何高效且有效地将其引入语音生成尤其是翻译任务仍是一个重要问题。具体而言,由于语音数据的低信息密度,转换后的离散语音单元序列远长于相应的文本转写,对现有自回归模型提出了重大挑战。此外,在忽视连续空间结构的情况下生硬地对语音单元序列施加离散扩散并非最优,这将显著劣化生成性能。在本文中,我们提出一种新颖的扩散模型,在\textit{连续}语音表示空间施加扩散前向过程,同时在\textit{离散}语音单元空间执行扩散反向过程。以此方式,我们在扩散过程中保持了连续语音表示空间的语义结构,并融合了连续与离散扩散模型。我们在无文本直接语音到语音翻译任务上进行了大量实验,所提方法以显著更少的解码步数(50 步)取得了与计算密集的自回归基线(平均 500 步)相当的结果。
引用
@article{arxiv.2310.17570,
title = {DiffS2UT: A Semantic Preserving Diffusion Model for Textless Direct Speech-to-Speech Translation},
author = {Yongxin Zhu and Zhujin Gao and Xinyuan Zhou and Zhongyi Ye and Linli Xu},
journal= {arXiv preprint arXiv:2310.17570},
year = {2023}
}
备注
Accepted in EMNLP2023 main conference