中文

MSLM-S2ST:一种用于无文本语音到语音翻译并保持说话人风格的多任务语音语言模型

计算与语言 2024-03-20 v1 声音 音频与语音处理

摘要

语音到语音翻译(S2ST),即将话语从一种语言翻译到另一种语言,已引起越来越多的研究兴趣并取得进展。本工作提出多任务语音语言模型(Multitask Speech Language Model, MSLM),这是一个在多任务设置下训练的仅解码器语音语言模型。在不依赖文本训练数据的情况下,我们的模型能够支持多语言 S2ST,并保持说话人风格。

关键词

引用

@article{arxiv.2403.12408,
  title  = {MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation},
  author = {Yifan Peng and Ilia Kulikov and Yilin Yang and Sravya Popuri and Hui Lu and Changhan Wang and Hongyu Gong},
  journal= {arXiv preprint arXiv:2403.12408},
  year   = {2024}
}