中文

基于公开数据的高效单阶段训练实现具有竞争力的音频-语言模型

声音 2026-01-23 v3 人工智能 计算与语言 机器学习

摘要

大型语言模型(LLMs)已经改变了自然语言处理,然而尽管音频在人类交流中占据核心地位,其与音频的整合仍未被充分探索。我们推出了Falcon3-Audio,这是一个基于指令微调LLMs和Whisper编码器构建的音频-语言模型(ALMs)系列。仅使用极少量(少于3万小时,其中5千小时为去重数据)的公开音频数据,Falcon3-Audio-7B在MMAU基准测试上取得了64.14分,与R1-AQA持平,匹配了开源模型中的最佳报告性能,同时以其卓越的数据和参数效率、单阶段训练以及透明度脱颖而出。值得注意的是,我们最小的1B模型仍然能与参数量从2B到13B不等的更大开源模型相竞争。通过广泛的消融研究,我们发现,即使与在超过50万小时数据上训练的模型相比,课程学习、多个音频编码器和复杂的交叉注意力连接器等常见复杂设计也并非取得强大性能所必需。

关键词

引用

@article{arxiv.2509.07526,
  title  = {Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data},
  author = {Gokul Karthik Kumar and Rishabh Saraf and Ludovick Lepauloux and Abdul Muneer and Billel Mokeddem and Hakim Hacid},
  journal= {arXiv preprint arXiv:2509.07526},
  year   = {2026}
}

备注

Accepted at ASRU 2025