ZSDEVC:基于扩散的解耦机制零样本情感语音转换
音频与语音处理
2025-09-29 v5
摘要
人类声音不仅传达文字,还传达情感状态和个性。情感语音转换 (Emotional voice conversion, EVC) 在保留语言内容和说话人身份的同时修改情感表达,改善了人机交互等应用。虽然深度学习在精心制作的情感数据集上推进了针对特定目标说话人的 EVC 模型,但现有方法通常面临情感准确性和语音失真的问题。此外,将情感转换应用于未见说话人的零样本场景仍然探索不足。这项工作引入了一种带有解耦机制和表达指导的新扩散框架,在大规模情感语音数据集上进行训练,并在跨域内和域外数据集的未见说话人上进行了评估。实验结果表明,我们的方法产生了具有高情感准确性、自然度和质量的表达性语音,展示了其在更广泛 EVC 应用中的潜力。
引用
@article{arxiv.2409.03636,
title = {ZSDEVC: Zero-Shot Diffusion-based Emotional Voice Conversion with Disentangled Mechanism},
author = {Hsing-Hang Chou and Yun-Shao Lin and Ching-Chin Sung and Yu Tsao and Chi-Chun Lee},
journal= {arXiv preprint arXiv:2409.03636},
year = {2025}
}
备注
5 pages; Proceedings of Interspeech