SpeechGen:以提示解锁语音语言模型的生成能力
音频与语音处理
2023-08-28 v3 人工智能
计算与语言
机器学习
摘要
大型语言模型(LLMs)因人工智能生成内容(AIGC)尤其是 ChatGPT 的出现而备受关注。然而,将连续语音直接适配于处理离散词元的 LLMs 仍是一项未解挑战,阻碍了 LLMs 在语音生成中的应用。先进的语音 LMs 处于边缘地位,因为语音信号除文本数据外还封装了包括说话人与情感在内的丰富信息。提示微调已在参数效率与某些语音分类任务的竞争性性能上展现出显著收益。然而,提示能在多大程度上有效引发语音 LMs 的生成任务仍是一个开放问题。在本文中,我们呈现了探索应用提示微调在统一框架 SpeechGen 中激发语音 LMs 执行多种生成任务的开拓性研究,其可训练参数约为 10M。所提统一框架在效率与有效性上极具前景,尤其随着先进语音 LMs 的即将到来,将显著增强该框架的能力。SpeechGen 的代码与演示将在项目网站提供:\url{https://ga642381.github.io/SpeechPrompt/speechgen}
引用
@article{arxiv.2306.02207,
title = {SpeechGen: Unlocking the Generative Power of Speech Language Models with Prompts},
author = {Haibin Wu and Kai-Wei Chang and Yuan-Kuei Wu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2306.02207},
year = {2023}
}
备注
Work in progress. The first three authors contributed equally