中文

通过源-滤波器网络解耦说话人无关情感以实现语音转换

音频与语音处理 2021-10-05 v1 机器学习 声音 信号处理

摘要

情感语音转换(VC)旨在将中性语音转换为情感语音(如开心),同时保留语言信息与说话人身份。我们注意到,将情感特征与其他语音信息(如说话人、内容等)解耦是实现优异性能的关键。近期关于中性语音上语音表示解耦的一些尝试在情感语音上表现不佳,因为后者涉及更复杂的声学特性。为解决此问题,我们提出一种新颖的基于源-滤波器的情感语音转换模型(SFEVC),以从音色与音高特征中适当滤除说话人无关的情感特征。我们的 SFEVC 模型由多通道编码器、情感分离编码器和一解码器组成。需注意,所有编码器模块均采用设计的信息瓶颈自编码器。此外,为进一步提升各类情感的转换质量,提出了一种基于二维效价-唤醒(VA)空间的新型两阶段训练策略。实验结果表明,所提 SFEVC 结合两阶段训练策略优于所有基线,并在非并行数据的说话人无关情感语音转换中达到最先进性能。

关键词

引用

@article{arxiv.2110.01164,
  title  = {Decoupling Speaker-Independent Emotions for Voice Conversion Via Source-Filter Networks},
  author = {Zhaojie Luo and Shoufeng Lin and Rui Liu and Jun Baba and Yuichiro Yoshikawa and Ishiguro Hiroshi},
  journal= {arXiv preprint arXiv:2110.01164},
  year   = {2021}
}