AVENet:基于近似平均特征解耦语音转换特征
声音
2025-04-09 v1
摘要
语音转换(VC)在特征解耦方面取得了进展,但仍难以平衡音色和内容信息。本文评估了在语音转换中常用的预训练模型特征,并提出一种创新方法用于解耦语音特征表示。具体而言,我们首先提出一种理想内容特征,称为平均特征,其通过对帧级对齐平行语音(FAPS)数据中的特征进行平均计算得出。为生成FAPS数据,我们利用一种技术方法,即冻结文本到语音系统中的时长预测器并操控说话人嵌入。为将平均特征适配到传统VC数据集,我们设计AVENet以特征为输入并生成与平均特征高度匹配的输出。对AVENet提取的特征在VC系统中的性能进行了实验测试。实验结果表明,其在多种当前语音特征解耦方法中均表现出优势。这些发现确认了我们解耦方法的有效性。
引用
@article{arxiv.2504.05833,
title = {AVENet: Disentangling Features by Approximating Average Features for Voice Conversion},
author = {Wenyu Wang and Yiquan Zhou and Jihua Zhu and Hongwu Ding and Jiacheng Xu and Shihao Li},
journal= {arXiv preprint arXiv:2504.05833},
year = {2025}
}
备注
Accepted by ICME 2025