中文

通用智能体的主动评估:问题定义与基线算法比较

人工智能 2026-02-12 v2 计算机科学与博弈论 机器学习 多智能体系统

摘要

随着智能体日益具备更广泛的能力,即能够掌握多种任务的能力,其正确评估的复杂度和成本显著增加。评估特定智能体能力的任务可能具有相关性和随机性,需要大量样本才能进行准确比较,从而增加成本。本文提出了智能体在多个任务上的主动评估的正式定义和概念框架,该框架以评估数据样本数为函数,评估排序算法的性能。与其对现有数据集进行预处理中的精选、筛选或压缩,我们提出一种在线方法:在每个迭代中,排序算法选择要从中抽取得分的任务和智能体。然后,评估算法在每个迭代上报告对智能体的排序,其性能随时间相对于ground truth排序进行评估。我们在不同实验情境下比较了几个基线算法,包括合成生成数据和仿真的在线访问真实评估数据(来自Atari游戏智能体)。我们发现,经典的Elo评级系统——尽管它已知存在一些问题——在实践中始终是一种可靠选择,用于有效减少排序误差。最近提出的方法,Soft Condorcet Optimization,在合成数据上表现与Elo相当,在真实的Atari智能体评估中显著优于Elo。当ground truth的任务变异性较高时,基于比例代表性选择任务可实现更高的排序误差降低率。

关键词

引用

@article{arxiv.2601.07651,
  title  = {Active Evaluation of General Agents: Problem Definition and Comparison of Baseline Algorithms},
  author = {Marc Lanctot and Kate Larson and Ian Gemp and Michael Kaisers},
  journal= {arXiv preprint arXiv:2601.07651},
  year   = {2026}
}

备注

AAMAS 2026