中文

基于离散单元的语音到语音翻译与风格迁移

声音 2024-07-22 v2 人工智能 音频与语音处理

摘要

基于离散自监督表示的直接语音到语音翻译(S2ST)已取得显著精度,但无法保留源语音的说话人音色。同时,高质量说话人平行数据的稀缺给在翻译中学习风格迁移带来挑战。我们设计了一种具备风格迁移能力的S2ST流程,基于离散自监督语音表示与codec单元。我们为风格迁移引入的声学语言模型利用自监督上下文学习,无需依赖任何说话人平行数据即可获得风格迁移能力,从而克服了数据稀缺问题。通过使用大量训练数据,我们的模型在先前未见过的源语言上实现了零样本跨语言风格迁移。实验表明,我们的模型生成的翻译语音具有高保真度与说话人相似度。音频样本可在 http://stylelm.github.io/ 获取。

关键词

引用

@article{arxiv.2309.07566,
  title  = {Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer},
  author = {Yongqi Wang and Jionghao Bai and Rongjie Huang and Ruiqi Li and Zhiqing Hong and Zhou Zhao},
  journal= {arXiv preprint arXiv:2309.07566},
  year   = {2024}
}

备注

accepted by ACL SRW 2024