基于上下文学习的零样旁音频转换的抑扬适应音频编解码器
声音
2025-09-30 v1 人工智能
音频与语音处理
摘要
离散音频编解码器的近期进展显著提升了语音表征建模,而编解码器语言模型已实现对零样语音合成的上下文学习。鼓舞此思路,本文提出置于VALLE-X框架内的语音转换(VC)模型,利用其强大的上下文学习能力进行说话人适应。为增强抑扬控制,我们引入抑扬感知的音频编解码器编码器(PACE)模块,该模块隔离并细化抑扬特征,提高表达性和控制灵活性。通过将PACE集成到我们的VC模型中,我们实现了对抑扬操作的 greater flexibility while preserving speaker timbre。实验评估结果表明,我们的方法在抑扬保留、音色一致性和整体自然度方面均优于基线VC系统。
引用
@article{arxiv.2505.15402,
title = {Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning},
author = {Junchuan Zhao and Xintong Wang and Ye Wang},
journal= {arXiv preprint arXiv:2505.15402},
year = {2025}
}
备注
5 pages, 3 figures