WhisperVC:面向低资源 Whisper-to-Normal 转换的解耦式跨域对齐与语音生成框架
音频与语音处理
2026-03-11 v2
摘要
嗓音语言 (whispered speech) 缺乏声纹振动,导致语音转换难以实现清晰的理解。我们提出了 WhisperVC,一个用于低资源 whisper-to-normal (W2N) 转换的三阶段框架,解耦跨域对齐与语音生成。阶段 1 使用有限的配对 whisper-normal 数据,结合内容编码器和基于 Conformer 的变分自编码器 (VAE),采用软-DTW 对齐学习领域不变的语义表示。阶段 2 仅在 normal speech 上训练,采用 Length-Channel Aligner 和双阶段说话人条件 mel 生成器进行声带和韵律建模。阶段 3 对 HiFi-GAN 声码器进行微调以完成波形合成。实验在 AISHELL6-Whisper 上显示出竞争性质量(DNSMOS 3.07,UTMOS 2.83,CER 16.93%)和 WavLM 说话人相似度 (0.95)。该框架还支持隐私保护通信、非声带通信以及术后声纹康复工具。样本可在线获取。
引用
@article{arxiv.2511.01056,
title = {WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion},
author = {Dong Liu and Juan Liu and Wei Ju and Yao Tian and Ming Li},
journal= {arXiv preprint arXiv:2511.01056},
year = {2026}
}
备注
submitted to Interspeech 2026