AHELM:音频-语言模型的全面评估
人工智能
2025-09-04 v2 计算与语言
摘要
音频-语言模型 (ALMs) 的评估存在诸多局限:缺乏标准化基准测试;大多数基准仅衡量一项或几项能力,遗漏公平性或安全性等评估方面;且不同模型间的比较困难,因为独立评估测试的模型数量有限,且使用不同的提示方法和推理参数。为此,本文提出 AHELM,一个聚合多个数据集的基准测试,包括 2 个新的合成音频-文本数据集:PARADE 用于评估 ALMs 在避免刻板印�方面的表现;CoRe-Bench 通过推理性多轮问答测量 ALMs 在对话音频中的推理能力。AHELM 旨在通过我们识别的 10 个关键方面(音频感知、知识、推理、情感检测、偏见、公平性、多语言性、鲁棒性、毒性与安全性)全面衡量 ALMs 的性能。我们标准化了提示、推理参数和评估指标,以确保模型间的公平比较。我们测试了 14 个开源和闭源 ALMs,来自 3 个开发商,以及 3 个简单的基线系统(每个由自动语音识别器和语言模型组成)。结果显示,Gemini 2.5 Pro 在 5 个方面中位居第一,但在语音识别任务中表现出组别不公平 (),而其他大多数模型未出现此问题。我们还发现,尽管基线系统仅具备语音转文本能力,却在 AHELM 上表现相当良好,其中一个系统总体排名第 6。为透明度,所有原始提示、模型生成和输出均在我们的网站 https://crfm.stanford.edu/helm/audio/v1.0.0/ 上提供。AHELM 旨�为一个活跃的基准测试,后续将持续添加新数据集和新模型。
引用
@article{arxiv.2508.21376,
title = {AHELM: A Holistic Evaluation of Audio-Language Models},
author = {Tony Lee and Haoqin Tu and Chi Heem Wong and Zijun Wang and Siwei Yang and Yifan Mai and Yuyin Zhou and Cihang Xie and Percy Liang},
journal= {arXiv preprint arXiv:2508.21376},
year = {2025}
}