VoxtLM:用于统一语音识别/合成及语音/文本续写任务的解码器仅模型
音频与语音处理
2024-01-25 v3 机器学习
声音
摘要
我们提出一种解码器仅语言模型VoxtLM,其可执行四项任务:语音识别、语音合成、文本生成和语音续写。VoxtLM将文本词表与来自自监督语音特征的离散语音令牌集成,并使用特殊令牌实现多任务学习。相较于单任务模型,VoxtLM在语音合成上表现出显著提升,语音可懂度从28.9降至5.6,客观质量从2.68升至3.90。VoxtLM在语音生成和语音识别性能上也优于单任务对应模型。此外,VoxtLM使用公开可用数据和训练方案进行训练,模型检查点已开源以实现完全可复现的工作。
引用
@article{arxiv.2309.07937,
title = {Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks},
author = {Soumi Maiti and Yifan Peng and Shukjae Choi and Jee-weon Jung and Xuankai Chang and Shinji Watanabe},
journal= {arXiv preprint arXiv:2309.07937},
year = {2024}
}