中文

Audio Flamingo Next:面向语音、声音和音乐的新一代开放音频-语言模型

声音 2026-04-14 v1 人工智能 计算与语言 音频与语音处理

摘要

我们提出了 Audio Flamingo Next (AF-Next),这是 Audio Flamingo 系列中新一代且能力最强的大型音频-语言模型,旨在推进对语音、环境声音和音乐的理解与推理。与 Audio Flamingo 3 相比,AF-Next 引入了:(i) 一个更强大的基础音频-语言模型,显著提高了跨多种音频理解任务的准确性;(ii) 可扩展的策略,用于构建超越现有学术基准的大规模音频理解与推理数据;(iii) 支持长达 30 分钟的长时复杂音频输入;(iv) 时间音频思维链,这是一种新的推理范式,将中间推理步骤显式地锚定在长音频的时间戳上,从而实现细粒度的时间对齐并提高可解释性。为了实现这些能力,我们首先对 Audio Flamingo 3 进行了系统分析,以识别音频理解与推理中的关键差距。然后,我们策划并扩展了总计超过 100 万小时的新的大规模数据集,以解决这些局限性,并扩充了现有的 AudioSkills-XL、LongAudio-XL、AF-Think 和 AF-Chat 数据集。AF-Next 采用基于课程学习的策略进行训练,涵盖预训练、中训练和后训练阶段。在包括具有挑战性的长音频任务在内的 20 个音频理解与推理基准上的大量实验表明,AF-Next 以大幅优势优于同等规模的开源模型,并且与规模大得多的开源和闭源模型相比,仍具有高度竞争力,有时甚至超越它们。除了基准性能外,AF-Next 还展现出强大的实际应用价值,并能很好地迁移到未见过的任务上,突显了其鲁棒性和泛化能力。除了所有数据、代码和方法外,我们还开源了 AF-Next 的 3 个变体,包括 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner。

关键词

引用

@article{arxiv.2604.10905,
  title  = {Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music},
  author = {Sreyan Ghosh and Arushi Goel and Kaousheik Jayakumar and Lasha Koroshinadze and Nishit Anand and Zhifeng Kong and Siddharth Gururani and Sang-gil Lee and Jaehyeon Kim and Aya Aljafari and Chao-Han Huck Yang and Sungwon Kim and Ramani Duraiswami and Dinesh Manocha and Mohammad Shoeybi and Bryan Catanzaro and Ming-Yu Liu and Wei Ping},
  journal= {arXiv preprint arXiv:2604.10905},
  year   = {2026}
}

备注

Project website: https://afnext-umd-nvidia.github.io/