AutoJudger:面向 MLLM 高效基准测试的智能体驱动框架
计算与语言
2025-05-28 v1
摘要
评估多模态大语言模型(MLLM)的成本日益高昂,因为基准测试的规模和跨模态复杂性不断增加,需要大量的评分工作。为了应对这一困难,我们引入了 AutoJudger,一个由智能体驱动的框架,用于对 MLLM 进行高效且自适应的基准测试,以应对这一不断攀升的成本。AutoJudger 采用项目反应理论(IRT)来估计问题难度,并使用一个自主评估智能体根据模型的实时表现动态选择信息量最大的测试问题。具体而言,AutoJudger 包含两个关键组件:一个语义感知检索机制,以确保所选问题涵盖视觉和语言两种模态中多样且具有挑战性的场景;以及一个动态记忆,它维护先前评估问题的上下文统计信息,以在整个评估过程中指导连贯且全局知情的题目选择。在四个具有代表性的多模态基准上的大量实验表明,我们的自适应框架显著降低了评估开销,即 AutoJudger 仅使用 4% 的数据,就在 MMT-Bench 上的完整基准评估中实现了超过 90% 的排序准确率。
引用
@article{arxiv.2505.21389,
title = {AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs},
author = {Xuanwen Ding and Chengjun Pan and Zejun Li and Jiwen Zhang and Siyuan Wang and Zhongyu Wei},
journal= {arXiv preprint arXiv:2505.21389},
year = {2025}
}