中文

Metis:一种基于掩码生成式预训练的基础语音生成模型

声音 2025-02-06 v1 人工智能 机器学习 音频与语音处理 信号处理

摘要

我们介绍 Metis,一个用于统一语音生成的基础模型。与以往的任务特定或多任务模型不同,Metis 遵循预训练和微调的范式。它使用掩码生成式建模在大规模无标注语音数据上进行预训练,然后进行微调以适应多样的语音生成任务。具体而言:1) Metis 利用两种离散语音表示:从语音自监督学习(SSL)特征中提取的 SSL 令牌,以及直接从波形量化的声学令牌。2) Metis 在没有任何额外条件的情况下,利用 30 万小时多样化的语音数据,对 SSL 令牌执行掩码生成式预训练。3) 通过使用任务特定条件进行微调,Metis 实现了对各种语音生成任务的高效适应,同时支持多模态输入,即使在使用有限数据和可训练参数的情况下也是如此。实验表明,Metis 可以作为统一语音生成的基础模型:在零样本文本到语音、语音转换、目标说话人提取、语音增强和唇语到语音这五项语音生成任务中,Metis 的性能均优于最先进的任务特定或多任务系统,即使其可训练参数少于 2000 万或训练数据少 300 倍。音频样本可在 https://metis-demo.github.io/ 获取。

关键词

引用

@article{arxiv.2502.03128,
  title  = {Metis: A Foundation Speech Generation Model with Masked Generative Pre-training},
  author = {Yuancheng Wang and Jiachen Zheng and Junan Zhang and Xueyao Zhang and Huan Liao and Zhizheng Wu},
  journal= {arXiv preprint arXiv:2502.03128},
  year   = {2025}
}