UniWav:面向语音表示学习与生成的统一预训练
音频与语音处理
2025-03-04 v1 计算与语言
声音
摘要
预训练与表示学习在现代语音处理中发挥着日益重要的作用。然而,由于主导性预训练技术要么为判别式任务设计,要么为生成式任务设计,因此不同应用依赖不同的基础模型。本 work首次尝试构建一种用于语音的统一预训练框架,同时适用于这两类任务。我们展示,通过适当的预训练设计选择,一个表示编码器与生成音频解码器可以同时学习,用于两种类型任务。我们提出UniWav,一个编码器-解码器框架,用于统一预训练表示学习与生成任务。在语音识别、文本语音合成和语音标记化任务上,UniWav的性能与各个现有基础模型相当,后者分别针对特定任务进行训练。我们的发现表明,可以构建一个通用于语音的单一通用基础模型,以取代不同的基础模型,从而降低预训练的开销和成本。
引用
@article{arxiv.2503.00733,
title = {UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation},
author = {Alexander H. Liu and Sang-gil Lee and Chao-Han Huck Yang and Yuan Gong and Yu-Chiang Frank Wang and James R. Glass and Rafael Valle and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2503.00733},
year = {2025}
}
备注
ICLR 2025; demo page at https://alexander-h-liu.github.io/uniwav-demo.github.io/