中文

对数评分,幂律发现:在基于智能体的评估中解耦度量与覆盖

人工智能 2026-04-02 v1 计算与语言 人机交互 多智能体系统

摘要

基于LLM的智能体评判者是一种新兴的对话式AI评估方法,但一个根本的不确定性依然存在:我们能否信任它们的评估?如果能,需要多少评估?通过15个任务上两个模型对的960轮会话,我们表明,在类图灵验证中,基于人格的智能体评判者产生的评估与人类评分者无法区分。然后,我们识别出一个评分-覆盖解耦:质量评分随评判小组规模呈对数增长,而独特问题的发现遵循次线性幂律——两者都表现出收益递减,但评分饱和的速度大约是发现的两倍。我们假设这反映了发现空间的幂律分布:关键问题首先被小组发现,而边缘情况需要逐渐增大的小组,类似于生态学中的物种累积曲线。其机制可追溯到集成多样性——大五人格条件化使智能体探索不同的质量维度,专家评判者充当对抗性探针,将发现推向发现分布的尾部。一项受控消融实验证实,产生这些缩放特性需要结构化的人格条件化,而非简单的提示。

关键词

引用

@article{arxiv.2604.00477,
  title  = {Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation},
  author = {HyunJoon Jung and William Na},
  journal= {arXiv preprint arXiv:2604.00477},
  year   = {2026}
}