SpeechX:作为通用语音变换器的神经编解码语言模型
音频与语音处理
2024-06-27 v2 计算与语言
机器学习
声音
摘要
近期基于音频-文本提示的生成式语音模型的进展实现了诸如高质量零样本文本到语音等显著创新。然而,现有模型在处理涉及转换输入语音和处理在恶劣声学条件下捕获的音频的多样化音频-文本语音生成任务时仍面临局限。本文介绍 SpeechX,一种能够进行零样本 TTS 及多种语音转换任务、可处理干净与含噪信号的通用语音生成模型。SpeechX 将神经编解码语言建模与基于任务相关提示的多任务学习相结合,实现了统一且可扩展的建模,并为在语音增强与转换任务中利用文本输入提供了一致的方式。实验结果表明,SpeechX 在各项任务中均有效,包括零样本 TTS、噪声抑制、目标说话人提取、语音去除以及带或不带背景噪声的语音编辑,在各任务上取得与专用模型相当或更优的性能。演示样本见 https://aka.ms/speechx。
引用
@article{arxiv.2308.06873,
title = {SpeechX: Neural Codec Language Model as a Versatile Speech Transformer},
author = {Xiaofei Wang and Manthan Thakker and Zhuo Chen and Naoyuki Kanda and Sefik Emre Eskimez and Sanyuan Chen and Min Tang and Shujie Liu and Jinyu Li and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2308.06873},
year = {2024}
}
备注
To appear in TASLP. See https://aka.ms/speechx for demo samples