Audio Flamingo:一种具备少样本学习和对话能力的新型音频语言模型
声音
2024-05-29 v3 机器学习
音频与语音处理
摘要
增强大语言模型(LLM)以理解音频——包括非语音声音和非语言语音——对于 LLM 的多样化现实世界应用至关重要。在本文中,我们提出了 Audio Flamingo,这是一种新型音频语言模型,具备:1) 强大的音频理解能力;2) 通过上下文学习和检索快速适应未见任务的能力;3) 强大的多轮对话能力。我们引入了一系列训练技术、架构设计和数据策略来增强模型的这些能力。在各种音频理解任务上的广泛评估证实了我们方法的有效性,并树立了新的最先进基准。我们的演示网站位于 https://audioflamingo.github.io/,代码已在 https://github.com/NVIDIA/audio-flamingo 开源。
引用
@article{arxiv.2402.01831,
title = {Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities},
author = {Zhifeng Kong and Arushi Goel and Rohan Badlani and Wei Ping and Rafael Valle and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2402.01831},
year = {2024}
}
备注
ICML 2024