UltraEval-Audio:面向音频基础模型的综合评估框架
声音
2026-01-06 v1 人工智能
音频与语音处理
摘要
自从 GPT-4o 出现后,音频基础模型的研发速度取得了显著进展。然而,缺乏全面的评估已成为该领域进一步进步的关键瓶颈,尤其是在音频生成方面。当前的音频评估面临三个主要挑战:(1) 音频评估缺乏统一的框架,数据集和代码分散在 various sources,不利于公平且高效的跨模型比较;(2) 作为音频基础模型关键组件的音频编解码器缺乏广受接受且全面的评估方法;(3) 现有语音基准严重依赖英文,对客观评估模型在中文表现提出了挑战。为解决第一个问题,我们引入 UltraEval-Audio,一个为音频基础模型提供统一评估框架,专为音频理解和生成任务而设计。UltraEval-Audio 具有模块化架构,支持 10 种语言和 14 个核心任务类别,同时无缝集成 24 个主流模型和 36 个权威基准。为提高研究效率,该框架提供一键式评估功能,并配备实时公开排行榜。为解决第二个挑战,UltraEval-Audio 采用一种新颖的全面评估方案,用于音频编解码器,在三个关键维度上进行评估:语义准确性、音调保真度和声学质量。为解决第三个问题,我们提出了两个新的中文基准,SpeechCMMLU 和 SpeechHSK,旨在评估中文知识熟练度和语言流畅度。我们期望 UltraEval-Audio 为学术界和产业界提供一个透明、高效且公平的比较平台。我们的代码、基准和排行榜已在 https://github.com/OpenBMB/UltraEval-Audio 上提供。
引用
@article{arxiv.2601.01373,
title = {UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models},
author = {Qundong Shi and Jie Zhou and Biyuan Lin and Junbo Cui and Guoyang Zeng and Yixuan Zhou and Ziyang Wang and Xin Liu and Zhen Luo and Yudong Wang and Zhiyuan Liu},
journal= {arXiv preprint arXiv:2601.01373},
year = {2026}
}
备注
13 pages, 2 figures