在语音中控制你的属性
声音
2025-01-06 v1 音频与语音处理
摘要
生成任务中的属性控制旨在修改个人属性(如年龄和性别),同时保留源样本中的身份信息。尽管在图像生成中控制面部属性方面已取得显著进展,但语音生成中的类似方法在很大程度上仍未被探索。本文提出了一种无需并行数据即可控制语音中说话人属性的新方法。我们的方法由两个主要部分组成:一个基于 GAN 的说话人表示变分自编码器,用于从说话人向量中提取说话人身份和属性;以及一个两阶段语音转换模型,用于捕捉语音中说话人属性的自然表达。实验结果表明,我们提出的方法不仅在说话人表示层面实现了属性控制,还能在语音层面操控说话人的年龄和性别,同时保持语音质量和说话人身份。
引用
@article{arxiv.2501.01674,
title = {Controlling your Attributes in Voice},
author = {Xuyuan Li and Zengqiang Shang. Li Wang and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2501.01674},
year = {2025}
}
备注
5 pages, 3 figures