中文

LauraGPT:基于 GPT 的听、注、懂与音频再生

声音 2024-07-04 v4 人工智能 机器学习 多媒体 音频与语音处理

摘要

生成式预训练 Transformer(GPT)模型已在多种自然语言处理任务上取得卓越表现,并展现出作为音频-文本大语言模型(LLMs)骨干的巨大潜力。以往主流音频-文本 LLM 使用离散音频 token 表示输入与输出音频;然而,在自动语音识别、语音到文本翻译及语音增强等任务上,其性能不及采用连续语音特征的模型。本文提出 LauraGPT,一种新颖的基于 GPT 的统一音频-文本 LLM,用于音频识别、理解与生成。LauraGPT 是一种通用 LLM,可处理音频与文本输入并生成任一模态的输出。我们提出一种结合连续与离散特征的音频数据表示新方案:LauraGPT 使用音频编码器将输入音频编码为连续表示,并从离散 codec 码生成输出音频。我们提出一步 codec 声码器以克服 codec token 多模态分布带来的预测难题。我们通过监督多任务学习微调 LauraGPT。大量实验表明,在内容、语义、副语言及音频信号分析相关的广泛音频任务(如自动语音识别、语音到文本翻译、文本到语音合成、语音增强、自动音频字幕、语音情感识别与口语理解)上,LauraGPT 相较强基线一致取得可比乃至更优的性能。

关键词

引用

@article{arxiv.2310.04673,
  title  = {LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT},
  author = {Zhihao Du and Jiaming Wang and Qian Chen and Yunfei Chu and Zhifu Gao and Zerui Li and Kai Hu and Xiaohuan Zhou and Jin Xu and Ziyang Ma and Wen Wang and Siqi Zheng and Chang Zhou and Zhijie Yan and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2310.04673},
  year   = {2024}
}

备注

10 pages, work in progress