中文

Eureka-Audio:激发紧凑语言模型中的音频智能

声音 2026-02-17 v1 人工智能

摘要

我们提出 Eureka-Audio,一种紧凑且高性能的音频语言模型,在广泛的音频理解基准测试中实现了与4至18倍参数量更大模型的竞争性能。尽管仅包含17亿参数,Eureka-Audio 在自动语音识别(ASR)、音频理解和密集音频描述方面表现出色,匹配或超越多个70亿至300亿参数的音频和多模态基线模型。该模型采用统一的端到端架构,由轻量级语言主干、基于 Whisper 的音频编码器以及稀疏激活的混合专家(Mixture-of-Experts, MoE)适配器组成,显式地考虑音频异质性,在有限容量下缓解跨模态优化冲突。为进一步增强 paralinguistic 推理,我们引入 DataFlux,一个闭环音频指令数据合成与验证管道,从原始音频中构建高质量、逻辑一致的监督信号。广泛的评估覆盖 ASR、知识推理、安全性、指令遵循和 paralinguistic 基准测试,表明 Eureka-Audio 在计算成本与性能之间实现了高效平衡。这些结果将 Eureka-Audio 确立为轻量级音频理解模型的强大且实用的基线。

关键词

引用

@article{arxiv.2602.13954,
  title  = {Eureka-Audio: Triggering Audio Intelligence in Compact Language Models},
  author = {Dan Zhang and Yishu Lei and Jing Hu and Shuwei He and Songhe Deng and Xianlong Luo and Danxiang Zhu and Shikun Feng and Rui Liu and Jingzhou He and Yu Sun and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2602.13954},
  year   = {2026}
}

备注

23 pages, 4 figures