中文

Whisper-GPT:一种混合表示音频大语言模型

声音 2024-12-20 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

我们提出WHISPER-GPT:一个用于语音和音乐的生成式大语言模型(LLM),允许我们在单个架构中同时处理连续音频表示和离散标记。近年来,利用从神经压缩算法(如ENCODEC)派生的离散音频标记的生成式音频、语音和音乐模型激增。然而,这种方法的一个主要缺点是处理上下文长度。如果要为下一个标记预测考虑所有音频内容在各种频率上的情况,基于标记的架构会导致上下文长度急剧增加。通过结合类似语谱图的连续音频表示和离散声学标记,我们保留了两种方法的优势:在单个标记中保留特定时间实例所需的全部音频信息,同时允许LLM预测未来标记,以实现采样等离散空间的优势。我们展示了与基于标记的语音和音乐LLM相比,我们的架构在下一个标记预测的困惑度和负对数似然得分方面取得了改进。

关键词

引用

@article{arxiv.2412.11449,
  title  = {Whisper-GPT: A Hybrid Representation Audio Large Language Model},
  author = {Prateek Verma},
  journal= {arXiv preprint arXiv:2412.11449},
  year   = {2024}
}

备注

6 pages, 3 figures. 50th International Conference on Acoustics, Speech and Signal Processing, Hyderabad, India