AU-Harness:用于音频大语言模型全面评估的开源工具包
声音
2026-05-12 v3 人工智能
机器学习
音频与语音处理
摘要
大型音频语言模型 (LALM) 正在快速发展,但其评估仍面临效率低下且缺乏标准化工具包的挑战,这限制了公平比较和系统性评估。现有评估框架存在三个关键局限性:(1) 处理流程缓慢且效率低下,成为大规模研究的瓶颈;(2) 多轮对话支持不足,留下了关于跨轮上下文集成和在持续对话中性能动态的根本问题未作答;(3) 缺乏能够与音频基准快速发展相适应的统一且可扩展的评估框架。为此,我们引入了 AU-Harness,这是一个高效且全面的 LALM 评估框架。我们的系统通过优化批量处理和并行执行,实现了相对于现有评估工具包最高可达 151% 的加速,使大规模评估先前被视为不切实际的目标成为可能。我们提供标准化的提示协议和灵活的配置选项,以便在多种情景下进行公平模型比较。AU-Harness 解锁了一系列困难的深入分析,这些分析在没有统一基础的情况下难以进行,包括多轮对话动态,使研究现有 LALM 的真正音频推理能力成为可能。AU-Harness 提供了实用的评估工具和模型局限性洞见,推动了系统性 LALM 开发。
引用
@article{arxiv.2509.08031,
title = {AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs},
author = {Hoang Nguyen and Sidharth Surapaneni and Akshay Kalkunte and Jash Mehta and Aman Tiwari and Oluwanifemi Bamgbose and Khyati Mahajan and Jash Shah and Shruthan Radhakrishna and Sathwik Tejaswi Madhusudhan and Vikas Yadav and Sai Rajeswar},
journal= {arXiv preprint arXiv:2509.08031},
year = {2026}
}