Audio Flamingo 2:具备长音频理解与专家推理能力的音频-语言模型
声音
2025-03-07 v1 计算与语言
机器学习
音频与语音处理
摘要
理解和推理非语音声音和音乐对于人类和 AI 智能体有效与其环境交互至关重要。在本文中,我们介绍了 Audio Flamingo 2(AF2),一种具备先进音频理解和推理能力的音频-语言模型(ALM)。AF2 利用(i)一个自定义 CLAP 模型,(ii)用于细粒度音频推理的合成音频问答数据,以及(iii)多阶段课程学习策略。AF2 仅使用 3B 参数的小型语言模型即达到最先进的性能,在超过 20 个基准测试中超越大型开源和专有模型。接下来,我们首次将音频理解扩展到长音频片段(30 秒至 5 分钟),并提出 LongAudio,一个用于训练 ALM 进行长音频描述和问答任务的大规模新颖数据集。在 LongAudio 上微调 AF2 在我们提出的 LongAudioBench 上取得了卓越表现,这是一个用于评估 ALM 长音频理解能力的专家标注基准。我们进行了广泛的消融研究以验证我们方法的有效性。项目网站:https://research.nvidia.com/labs/adlr/AF2/。
引用
@article{arxiv.2503.03983,
title = {Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities},
author = {Sreyan Ghosh and Zhifeng Kong and Sonal Kumar and S Sakshi and Jaehyeon Kim and Wei Ping and Rafael Valle and Dinesh Manocha and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2503.03983},
year = {2025}
}