无文本且非并行的语音到语音情感风格迁移
音频与语音处理
2026-03-11 v2 声音
摘要
给定一对源语音和参考语音录音,语音到语音(S2S)情感风格迁移涉及生成模仿参考语音情感特征同时保留源语音内容和说话人属性的输出语音。在本文中,我们提出了一种语音到语音零样本情感风格迁移框架,称为S2S零样本情感风格迁移(S2S-ZEST),能够在将情感属性从参考语音转移到源语音的同时保留说话人身份和语音内容。S2S-ZEST框架由一个分析-合成流水线组成,其中分析模块从语音中提取语义标记、说话人表征和情感嵌入。利用这些表征,学习了音高轮廓估计器和持续时间预测器。此外,设计了一个合成模块,基于输入表征和推导出的因素生成语音。分析-合成流水线使用自编码目标进行训练,以便在推理时实现高效重合成。对于S2S情感风格迁移,从参考语音中提取的情感嵌入以及来自源语音的其余表征被用于合成模块中以生成风格迁移后的语音。在实验中,我们根据源语音评估转换后的语音在内容和说话人保持方面的表现,以及根据参考语音评估情感风格迁移的有效性。所提出的框架在无文本且非并行的设置中展示了优于先前方法的情感风格迁移性能。我们还展示了该工作在情感识别任务中用于数据增强的应用。
引用
@article{arxiv.2505.17655,
title = {Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer},
author = {Soumya Dutta and Avni Jain and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2505.17655},
year = {2026}
}
备注
11 pages, 10 figures, 6 tables