中文

面向大模型的多智能体持续评估网络 MACEval

计算机视觉与模式识别 2026-02-02 v2

摘要

过去几年涌现出大量专用于评估大型模型的基准测试,但大多数基准测试保持封闭式设计,易受数据污染影响导致过拟合。此外,当前基准测试规模与范围日益扩大,指标更迭频繁,人工策源过程依赖度高,带来及时维护和适配的显著挑战。本文介绍 MACEval(Multi-Agent Continual Evaluation network),用于大型模型的动态评估网络,定义新指标以量化性能的纵向变化。MACEval 采用交互式自主评估模式,运用角色分配、过程数据生成和级联智能体网络中的评估路由。23 个大型模型上的大量实验表明 MACEval 的有效性,同时减轻了评估过程的负担,显著降低了开销。我们期望 MACEval 能拓展大型模型评估的未来方向。项目页面:https://github.com/zijianchen98/MACEval。

关键词

引用

@article{arxiv.2511.09139,
  title  = {MACEval: A Multi-Agent Continual Evaluation Network for Large Models},
  author = {Zijian Chen and Yuze Sun and Yuan Tian and Wenjun Zhang and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2511.09139},
  year   = {2026}
}

备注

32 pages, 14 figures