DurFlex-EVC:无需文本对齐、利用离散表示的时长灵活情感语音转换
声音
2025-01-22 v4 人工智能
音频与语音处理
摘要
情感语音转换(EVC)涉及修改各种声学特征,如基频和频谱包络,以匹配所需的情感状态,同时保留说话人身份。现有的EVC方法通常依赖文本转录或时间对齐信息,难以有效处理变化的语音时长。在本文中,我们提出了DurFlex-EVC,一个无需文本或对齐信息即可运行的时长灵活EVC框架。我们引入了一个单元对齐器,通过将语音与表示内容的离散单元对齐来建模上下文信息,从而消除了对文本或语音-文本对齐的需求。此外,我们设计了一个风格自编码器,有效解耦内容和情感风格,允许精确操控语音的情感特征。我们通过一个分层风格化编码器进一步增强情感表现力,该编码器在多个层级上应用目标情感风格,细化风格化过程,以提高转换后语音的自然度和表现力。主观和客观评估的实验结果表明,我们的方法优于基线模型,有效处理了时长变化,并增强了转换后语音的情感表现力。
引用
@article{arxiv.2401.08095,
title = {DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment},
author = {Hyung-Seok Oh and Sang-Hoon Lee and Deok-Hyeon Cho and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2401.08095},
year = {2025}
}
备注
15 pages, 11 figures, 12 tables