ChronosAudio:面向评估音频大语言模型长时段理解的综合基准
声音
2026-05-28 v2
摘要
虽然音频大语言模型(ALLM)取得了显著进展,但其长时段音频理解能力尚未得到探索。已有众多基准用于通用音频任务,主要聚焦于短时段片段,缺乏对 ALLM 长时段音频的统一评估标准。本文提出 ChronosAudio,首个针对 ALLM 长时段音频理解设计的多任务基准。其包含六大任务类别,涵盖 36,000 条测试样本,累计超过 200 小时音频,按短、中、长时段划分,全面评估长度泛化能力。对 16 个最新模型进行大规模实验,得出三个关键发现:1. 长时段语境崩溃:ALLM 在维持性能方面严重不足,短时段到长时段语境的转换导致特定任务性能急剧下降超过 90%;2. 结构注意力稀释:性能下降源于难以维持时间局部性,注意力机制在后续序列中出现显著扩散;3. 恢复天花板:当前缓解策略仅实现约 50% 的恢复。这些发现揭示了长时段音频处理中的深层挑战,凸显亟需方法以实现鲁棒的文档级音频推理。
引用
@article{arxiv.2601.04876,
title = {ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models},
author = {Kaiwen Luo and Liang Lin and Yibo Zhang and Moayad Aloqaily and Jialiang Tao and Dexian Wang and Zhenhong Zhou and Junwei Zhang and Kun Wang and Li Sun and Qingsong Wen},
journal= {arXiv preprint arXiv:2601.04876},
year = {2026}
}