中文

Make Some Noise:面向 LLM 音频推理与生成的声音标记

音频与语音处理 2025-03-31 v1 人工智能 声音

摘要

将音频理解与生成集成到大语言模型(LLM)仍具有挑战性,主要由于音频的连续性质导致采样率较高。本文提出一种新方法,结合变分量化(Variational Quantization)与条件流匹配(Conditional Flow Matching),将音频转换为 0.23 kbps 的超低比特率离散标记,实现与文本标记的无缝集成。我们使用低秩适应(Low-Rank Adaptation, LoRA)对预训练文本基 LLM 进行微调,以评估其在实现真正多模态能力(音频理解与生成)方面的效果。我们的标记器在多样化声学事件数据集上超越传统 VQ-VAE。尽管通过音频标记化导致细粒度细节显著损失,但使用离散标记训练的多模态 LLM 在音频理解方面达到与最新方法相当的成绩,仅音频生成表现较差。我们的结果表明,需进一步积累更大规模且更具多样性的数据集,并改进评估指标,以推动多模态 LLM 的发展。

关键词

引用

@article{arxiv.2503.22275,
  title  = {Make Some Noise: Towards LLM audio reasoning and generation using sound tokens},
  author = {Shivam Mehta and Nebojsa Jojic and Hannes Gamper},
  journal= {arXiv preprint arXiv:2503.22275},
  year   = {2025}
}

备注

5 pages, 2 figures, Accepted at ICASSP 2025