中文

在语音中控制你的属性

声音 2025-01-06 v1 音频与语音处理

摘要

生成任务中的属性控制旨在修改个人属性(如年龄和性别),同时保留源样本中的身份信息。尽管在图像生成中控制面部属性方面已取得显著进展,但语音生成中的类似方法在很大程度上仍未被探索。本文提出了一种无需并行数据即可控制语音中说话人属性的新方法。我们的方法由两个主要部分组成:一个基于 GAN 的说话人表示变分自编码器,用于从说话人向量中提取说话人身份和属性;以及一个两阶段语音转换模型,用于捕捉语音中说话人属性的自然表达。实验结果表明,我们提出的方法不仅在说话人表示层面实现了属性控制,还能在语音层面操控说话人的年龄和性别,同时保持语音质量和说话人身份。

关键词

引用

@article{arxiv.2501.01674,
  title  = {Controlling your Attributes in Voice},
  author = {Xuyuan Li and Zengqiang Shang. Li Wang and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2501.01674},
  year   = {2025}
}

备注

5 pages, 3 figures