通用语音内容分解
音频与语音处理
2026-03-11 v1 声音
摘要
我们提出了通用语音内容分解(Universal Speech Content Factorization, USCF),这是一种简单且可逆的线性方法,用于提取低秩语音表示,在抑制说话人声纹的同时保留语音内容。USCF 将语音内容分解这一闭合集语音转换(VC)方法扩展到开放集场景,通过最小二乘优化学习通用语音到内容映射,并仅需数秒目标语音数据即可推导出说话人特定的变换。我们通过嵌入分析表明,USCF 有效消除了说话人依赖的变异性。作为零样本语音转换系统,USCF 在可读性、自然度和说话人相似性方面与需要大量目标说话人数据或额外神经网络训练的方法保持竞争力。最终,我们展示了作为训练高效声学特征的 timbre-disentangled 语音特征,USCF 特征可作为训练声学表示,用于声学驱动的文本到语音模型。语音样本和代码均已公开。
引用
@article{arxiv.2603.08977,
title = {Universal Speech Content Factorization},
author = {Henry Li Xinyuan and Zexin Cai and Lin Zhang and Leibny Paola García-Perera and Berrak Sisman and Sanjeev Khudanpur and Nicholas Andrews and Matthew Wiesner},
journal= {arXiv preprint arXiv:2603.08977},
year = {2026}
}