Conan:一种用于零样态自适应语音转换的分块在线网络
音频与语音处理
2025-09-03 v4 计算与语言
声音
摘要
零样态在线语音转换对实时通信和娱乐具有巨大的潜力。然而,当前的语音转换模型在实时约束下难以保持语义保真度、交付自然的转换效果,并且对未见说话人特征适应效果不佳。为此,我们引入 Conan,一款能够在源内容保持的同时匹配参考语音声 timbre 和风格的分块零样态语音转换模型。Conan 由三个核心组件构成:1) 利用 Emformer 实现低延迟流式内容编码的 Stream Content Extractor;2) 从参考语音中提取细粒度风格特征以增强风格适应的 Adaptive Style Encoder;3) 实现全因果的 HiFiGAN 的 Causal Shuffle Vocoder。实验评估表明,Conan 在主观和客观指标上均优于基线模型。音频样本可在 https://aaronz345.github.io/ConanDemo 观看。
引用
@article{arxiv.2507.14534,
title = {Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion},
author = {Yu Zhang and Baotong Tian and Zhiyao Duan},
journal= {arXiv preprint arXiv:2507.14534},
year = {2025}
}
备注
Accepted by ASRU 2025