基于人在回路坐标下降的个性化语音合成
音频与语音处理
2025-05-27 v5 声音
摘要
本文描述了一种在缺乏目标说话人参考语音数据的情况下,进行个性化语音合成的人在回路方法。其旨在帮助发声障碍个体恢复其失去的声音,而无需任何先前的录音。所提出的方法利用了学习到的说话人嵌入空间。从初始语音开始,用户在听觉感知的引导下,通过类似坐标下降的过程迭代地细化说话人嵌入参数。通过分析潜在空间,可以注意到嵌入参数对应于感知语音属性,包括音高、声带张力、亮度和鼻音,这使得搜索过程直观。计算机模拟和真实世界用户研究表明,所提出的方法在多种测试用例中近似目标语音是有效的。
引用
@article{arxiv.2408.17068,
title = {Personalized Voice Synthesis through Human-in-the-Loop Coordinate Descent},
author = {Yusheng Tian and Junbin Liu and Tan Lee},
journal= {arXiv preprint arXiv:2408.17068},
year = {2025}
}
备注
work in progress