AudioMarathon:用于长上下文音频理解与效率的综合基准
声音
2025-10-09 v1 人工智能
计算与语言
音频与语音处理
摘要
处理长时段音频是大型音频语言模型(LALM)面临的主要挑战。这类模型在注意力()的二次计算成本以及建模长程时序依赖性方面存在困难。现有音频基准主要来自短片段,无法在真实的长上下文环境中对模型进行评估。为弥合这一差距,我们引入AudioMarathon,一个旨在评估长时段音频理解与推理效率的基准。AudioMarathon 提供了多样化的任务集合,基于三个支柱构建:长时段音频输入,时长范围为 90.0 到 300.0 秒,分别对应编码后的 2,250 至 7,500 个音频 token;完整的语音、声音和音乐领域覆盖;以及需要多跳推理的复杂推理任务。我们对最先进的 LALM 进行评估,发现随着音频长度增长,模型性能明显下降。我们还研究了加速技术并分析了 token 剪枝和 KV 缓存驱逐之间的权衡。结果显示当前 LALM 之间存在显著差距,凸显了在时序推理和内存高效架构方面的需求。我们相信AudioMarathon将推动音频和多模态研究社区发展出更先进的音频理解模型,以解决复杂音频任务。
引用
@article{arxiv.2510.07293,
title = {AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs},
author = {Peize He and Zichen Wen and Yubo Wang and Yuxuan Wang and Xiaoqian Liu and Jiajie Huang and Zehui Lei and Zhuangcheng Gu and Xiangqi Jin and Jiabing Yang and Kai Li and Zhifei Liu and Weijia Li and Cunxiang Wang and Conghui He and Linfeng Zhang},
journal= {arXiv preprint arXiv:2510.07293},
year = {2025}
}
备注
26 pages, 23 figures, the code is available at \url{https://github.com/DabDans/AudioMarathon}