面向 TTS 的零样本跨语言声音转换
音频与语音处理
2024-09-24 v1 声音
摘要
在本文中,我们引入了一个零样本声音转换模块,该模块可无缝集成到多语言文本转语音(TTS)系统中,以实现个人声音的跨语言转换。我们提出的 VT 模块包含处理参考语音的说话人编码器、瓶颈层以及连接到现有 TTS 层的残差适配器。我们比较了这些组件的各种配置的性能,并报告了跨语言的平均意见分(MOS)和说话人相似度。使用每个说话人的一段英语参考语音,我们在九种目标语言上实现了 73% 的平均声音转换相似度得分。声音特征对个人身份的建构和感知有重要贡献。由于生理或神经状况导致的声音丧失,会带来深刻的失落感,影响个人的核心身份。作为案例研究,我们证明我们的方法不仅能转换典型语音,还能在仅有非典型语音样本可用时恢复构音障碍患者的声音——这对于从未有过典型语音或保存过其声音的人来说是一项极具价值的实用功能。跨语言典型音频样本以及展示构音障碍说话人声音恢复的视频可在此处获取 (google.github.io/tacotron/publications/zero_shot_voice_transfer)。
引用
@article{arxiv.2409.13910,
title = {Zero-shot Cross-lingual Voice Transfer for TTS},
author = {Fadi Biadsy and Youzheng Chen and Isaac Elias and Kyle Kastner and Gary Wang and Andrew Rosenberg and Bhuvana Ramabhadran},
journal= {arXiv preprint arXiv:2409.13910},
year = {2024}
}
备注
Submitted to ICASSP