中文

能力可不是全部:衡量AI中的倾向性

机器学习 2026-03-03 v4 人工智能

摘要

AI评估主要侧重于衡量能力,受项目反应理论(IRT)启发的正式方法正日益增多。然而,倾向性——模型表现出特定行为的倾向——在决定性能和安全结果方面才作为核心作用。然而,传统的IRT将模型在任务上的成功描述为模型能力与任务需求单调函数,这种方法不适用于倾向性,因为不足和过量都可能是有问题的。本文引入了衡量AI倾向性的首个正式框架,通过双对数函数来描述模型成功概率,该函数将模型倾向性位于“理想带”内时,成功概率最高。进一步,我们利用配备新开发任务无关评分标准的大语言模型(LLM)来估计理想带的限制。将我们的框架应用于六类倾向性在不同方向上被激发的LLM模型时,我们发现可以衡量倾向性偏移的程度以及这种偏移对任务的影响。关键的是,使用一个基准估计的倾向性能够成功预测在保留任务上的行为。此外,结合倾向性和能力的预测能力优于单独使用两种方法。更广泛地说,我们的框架展示了如何进行严谨的倾向性测量,以及如何通过预测AI行为获得于仅依赖能力评估的优势。

关键词

引用

@article{arxiv.2602.18182,
  title  = {Capabilities Ain't All You Need: Measuring Propensities in AI},
  author = {Daniel Romero-Alvarado and Fernando Martínez-Plumed and Lorenzo Pacchiardi and Hugo Save and Siddhesh Milind Pawar and Behzad Mehrbakhsh and Pablo Antonio Moreno Casares and Ben Slater and Paolo Bova and Peter Romero and Zachary R. Tidler and Jonathan Prunty and Luning Sun and Jose Hernandez-Orallo},
  journal= {arXiv preprint arXiv:2602.18182},
  year   = {2026}
}