中文

StyleS2ST:面向直接语音到语音翻译的零样本风格迁移

声音 2023-07-26 v4 音频与语音处理

摘要

直接语音到语音翻译(S2ST)相较于级联式 S2ST 具有诸多优势,已逐渐受到关注。然而,当前研究主要关注语义翻译的准确性,而忽略了从源语言到目标语言的语音风格迁移。高保真表现力平行数据的缺乏使得此类风格迁移具有挑战性,尤其是在更实际的零样本场景中。为解决该问题,我们首先利用多语言多说话人文本到语音合成(TTS)系统构建平行语料,随后在直接 S2ST 系统框架上基于风格适配器提出具备跨语言语音风格迁移能力的 StyleS2ST 模型。通过平行语料训练与非平行 TTS 数据增强实现声学模型的连续风格空间建模,StyleS2ST 捕获从源语言到目标语言的跨语言声学特征映射。实验表明,StyleS2ST 在集内与集外零样本场景中均取得了良好的风格相似度与自然度。

关键词

引用

@article{arxiv.2305.17732,
  title  = {StyleS2ST: Zero-shot Style Transfer for Direct Speech-to-speech Translation},
  author = {Kun Song and Yi Ren and Yi Lei and Chunfeng Wang and Kun Wei and Lei Xie and Xiang Yin and Zejun Ma},
  journal= {arXiv preprint arXiv:2305.17732},
  year   = {2023}
}

备注

Accepted to Interspeech 2023