基于模型编辑的特征声合成用于说话人生成
声音
2025-07-08 v1 音频与语音处理
摘要
说话人生成任务旨在创建无需参考语音的无见说话人声音。该任务的关键在于定义能够代表多种说话人的说话人空间,以确定生成的说话人特征。然而,有效定义此说话人空间的方法仍不明确。特征声合成是传统参数化合成框架(如基于 HMM 的方法)中的一个有前景的方案,这些方法使用预存储的说话人特征定义低维说话人空间。本研究提出了一种基于深度神经网络 (DNN) 的新型特征声合成方法,通过模型编辑实现。不同于先前方法,本方法在 DNN 模型参数空间中定义说话人空间。通过直接在该空间中采样新的 DNN 模型参数,可以生成多样化的说话人声音。实验结果表明,我们的方法能够生成多样化的说话人语音。此外,我们发现所创建的说话人空间中存在一种性别主导轴,表明有潜力可用于控制说话人属性。
引用
@article{arxiv.2507.03377,
title = {Eigenvoice Synthesis based on Model Editing for Speaker Generation},
author = {Masato Murata and Koichi Miyazaki and Tomoki Koriyama and Tomoki Toda},
journal= {arXiv preprint arXiv:2507.03377},
year = {2025}
}
备注
Accepted by INTERSPEECH 2025