SpeechComposer:利用提示组合统一多种语音任务
计算与语言
2024-02-01 v1 人工智能
声音
音频与语音处理
摘要
语言模型的最新进展显著提升了多种语音相关任务的性能。现有的语音语言模型通常利用任务相关的提示标记,将各种语音任务统一在单一模型中。然而,这种设计忽略了不同语音任务之间的内在联系,而这些联系可能提升每个任务的性能。在这项工作中,我们提出了一种新颖的仅解码器语音语言模型 SpeechComposer,它可以通过组合一组固定的提示标记来统一常见的语音任务。基于四项主要任务——语音合成、语音识别、语音语言建模和文本语言建模——SpeechComposer 可以通过精心设计的提示标记组合(如语音转换和语音增强)轻松扩展到更多语音任务。提示标记的统一也使得不同语音任务之间能够以更结构化的方式共享知识。实验结果表明,我们提出的 SpeechComposer 能够提升主要任务和组合任务的性能,显示了共享提示标记的有效性。值得注意的是,统一的仅解码器模型取得了与为单一任务设计的专家模型基线相当甚至更好的性能。
引用
@article{arxiv.2401.18045,
title = {SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition},
author = {Yihan Wu and Soumi Maiti and Yifan Peng and Wangyou Zhang and Chenda Li and Yuyue Wang and Xihua Wang and Shinji Watanabe and Ruihua Song},
journal= {arXiv preprint arXiv:2401.18045},
year = {2024}
}
备注
11 pages, 2 figures