面向大模型的多智能体持续评估网络 MACEval
计算机视觉与模式识别
2026-02-02 v2
摘要
过去几年涌现出大量专用于评估大型模型的基准测试,但大多数基准测试保持封闭式设计,易受数据污染影响导致过拟合。此外,当前基准测试规模与范围日益扩大,指标更迭频繁,人工策源过程依赖度高,带来及时维护和适配的显著挑战。本文介绍 MACEval(Multi-Agent Continual Evaluation network),用于大型模型的动态评估网络,定义新指标以量化性能的纵向变化。MACEval 采用交互式自主评估模式,运用角色分配、过程数据生成和级联智能体网络中的评估路由。23 个大型模型上的大量实验表明 MACEval 的有效性,同时减轻了评估过程的负担,显著降低了开销。我们期望 MACEval 能拓展大型模型评估的未来方向。项目页面:https://github.com/zijianchen98/MACEval。
引用
@article{arxiv.2511.09139,
title = {MACEval: A Multi-Agent Continual Evaluation Network for Large Models},
author = {Zijian Chen and Yuze Sun and Yuan Tian and Wenjun Zhang and Guangtao Zhai},
journal= {arXiv preprint arXiv:2511.09139},
year = {2026}
}
备注
32 pages, 14 figures