ASRRL-TTS:面向文本到语音说话人自适应的敏捷说话人表征强化学习
音频与语音处理
2024-07-09 v1 声音
摘要
说话人自适应,即在文本到语音任务中克隆未见说话人的声音,因其在多媒体领域的众多应用而引起了广泛兴趣。尽管近期取得了进展,但现有方法在处理有限参考语音场景时,常常面临说话人表征精度不足和过拟合的挑战。为解决这些问题,我们提出了一种敏捷说话人表征强化学习策略,以增强说话人自适应任务中的说话人相似度。ASRRL 是首个将强化学习应用于提升说话人自适应中说话人嵌入建模精度的工作,解决了语音内容和音色解耦的难题。我们的方法引入了两种针对不同参考语音场景定制的动作策略。在单句场景中,采用一种面向知识的最优路径搜索强化学习方法,以加速对说话人表征边缘的细化信息的探索和检索。在少句场景中,我们利用一种动态强化学习方法自适应地融合参考语音,增强了说话人建模的鲁棒性和准确性。为了在目标域中获得最优结果,我们提出了一种基于多尺度融合评分机制的奖励模型,该模型从三个维度评估说话人相似度、语音质量和可懂度,确保说话人相似度的提升不会损害语音质量或可懂度。在主流TTS框架内,基于LibriTTS和VCTK数据集的实验结果表明,所提出的ASRRL方法具有良好的可扩展性和泛化能力。结果表明,ASRRL方法显著优于传统的微调方法,在有限参考语音下实现了更高的说话人相似度和更好的整体语音质量。
引用
@article{arxiv.2407.05421,
title = {ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation},
author = {Ruibo Fu and Xin Qi and Zhengqi Wen and Jianhua Tao and Tao Wang and Chunyu Qiang and Zhiyong Wang and Yi Lu and Xiaopeng Wang and Shuchen Shi and Yukun Liu and Xuefei Liu and Shuai Zhang},
journal= {arXiv preprint arXiv:2407.05421},
year = {2024}
}
备注
The audio demo is available at https://7xin.github.io/ASRRL/