中文

WavCube:通过语义-声学联合建模统一语音理解与生成的语音表示

音频与语音处理 2026-05-08 v1 人工智能 计算与语言

摘要

整合语音理解与生成是构建统一语音模型的关键步骤。然而,这两项任务所需的不同表示目前带来了重大的兼容性挑战。通常,面向语义的特征从自监督学习 (SSL) 中学习,而面向声学的特征从重构中学习。这种碎片化的表示阻碍了真正统一的语音系统的实现。我们提出了 WavCube,一种从 SSL 语音编码器导出的紧凑连续潜在表示,可同时支持语音理解、重构和生成。WavCube 采用两阶段训练方案。阶段 1 训练一个语义瓶颈以过滤流形外冗余,这些冗余使得原始 SSL 特征难以用于扩散。阶段 2 通过端到端重构注入细粒度声学细节,同时语义锚定损失确保表示保持在其原始语义流形内。综合实验表明,尽管有 8 倍的维度压缩,WavCube 在 SUPERB 上接近 WavLM 的性能,获得了与现有声学表示相当的重构质量,以显著更快的训练收敛速度提供了最先进的零样本 TTS 性能,并在 SUPERB-SG 基准上的语音增强、分离和声音转换任务中表现出色。系统消融研究表明,WavCube 的两阶段方案解决了 SSL 特征用于生成建模的两个固有缺陷,为未来的统一语音系统铺平了道路。代码和检查点可在 https://github.com/yanghaha0908/WavCube 获取。

关键词

引用

@article{arxiv.2605.06407,
  title  = {WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling},
  author = {Guanrou Yang and Tian Tan and Qian Chen and Zhikang Niu and Yakun Song and Ziyang Ma and Yushen Chen and Zeyu Xie and Tianrui Wang and Yifan Yang and Wenxi Chen and Qi Chen and Wenrui Liu and Shan Yang and Xie Chen},
  journal= {arXiv preprint arXiv:2605.06407},
  year   = {2026}
}