改进非自回式零样态表达语音转换中的离散表示
声音
2025-06-05 v1 人工智能
音频与语音处理
摘要
表达语音转换旨在将目标语音中的说话人身份和表达属性均转化到给定的源语音上。本文改进了基于条件变分自编码器的自监督非自回式框架,重点降低源声色泄漏并提升语言-声学特征的离散化,以实现更好的风格迁移。为最小化风格泄漏,我们采用多语言离散语音单元作为内容表示,并通过基于增强的相似度损失和混合风格层归一化来强化嵌入。为提升表达性迁移,我们通过交叉注意力机制引入局部 F0 信息,并提取包含全局音高和能量特征的风格嵌入。实验表明,我们的模型在情感和说话人相似性方面均优于基线,显示出卓越的风格适应能力和较低的源风格泄漏。
引用
@article{arxiv.2506.04013,
title = {Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion},
author = {Seymanur Akti and Tuan Nam Nguyen and Alexander Waibel},
journal= {arXiv preprint arXiv:2506.04013},
year = {2025}
}
备注
Accepted to Interspeech 2025