中文

在此环境、如此说话者:面向多属性语音转换的文本驱动框架

声音 2025-06-16 v2 音频与语音处理

摘要

我们提出 TES-VC(Text-driven Environment and Speaker controllable Voice Conversion),即文本驱动语音转换框架,实现说话人声纹与环境声学的独立可控。TES-VC 处理目标语音与环境的同时文本输入,准确生成符合描述声纹/环境的语音,同时保留源内容。基于通过潜在扩散建模解耦 vocal/environment 特征的合成数据进行训练,我们的方法消除了属性之间的干扰。检索式声纹控制(RBTC)模块 enables 使用抽象描述进行精确操控,且无需配对数据。实验表明 TES-VC 能在保持高内容保留率和卓越可控性的同时,有效生成语境恰当的语音,展示了其在广泛应用中的潜力。

关键词

引用

@article{arxiv.2506.07036,
  title  = {In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion},
  author = {Jiawei Jin and Zhihan Yang and Yixuan Zhou and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2506.07036},
  year   = {2025}
}

备注

Accepted by Interspeech2025