中文

一种用于一次迁移歌唱声音转换的分层说话人表征框架

音频与语音处理 2022-07-07 v2 声音

摘要

通常,歌唱声音转换(SVC)依赖于从说话人查找表(LUT)或说话人识别网络(SRN)提取的嵌入向量来建模说话人身份。然而,歌唱比会话语音包含更具表现力的说话人特征。据推测,单一嵌入向量可能仅捕获平均且粗粒度的说话人特征,不足以胜任SVC任务。为此,本工作提出一种新颖的用于SVC的分层说话人表征框架,可捕获不同粒度的细粒度说话人特征。其由一个上采样流与三个下采样流组成。上采样流将语言特征转换为音频样本,而三个下采样流之一反向运作。期望每个下采样块的时间统计可表征不同粒度的说话人特征,并参与上采样块以增强说话人建模。实验结果验证了所提方法优于基于LUT和SRN的SVC系统。此外,所提系统仅需数秒参考音频即可支持一次迁移SVC。

关键词

引用

@article{arxiv.2206.13762,
  title  = {A Hierarchical Speaker Representation Framework for One-shot Singing Voice Conversion},
  author = {Xu Li and Shansong Liu and Ying Shan},
  journal= {arXiv preprint arXiv:2206.13762},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022; Made some motifications in Fig.1 so that the system architecture will be more clear