衡量AI系统可能做什么:迈向AI测量科学
计算机与社会
2026-03-03 v1 人工智能
机器学习
摘要
科学家、政策制定者、企业领导者和公众都关心现代人工智能系统的倾向性。然而,诸如'能力'、'倾向'、'技能'、'价值'和'能力'等术语常被交替使用并等同于可观测性能,而AI评估实践很少指定它们测量的量是什么。我们认为能力和倾向是 disposition 属性——由情境条件与行为输出之间反事实关系特征的稳定系统特征。测量一种 disposition 需要(i)假设哪些情境属性是因果相关的,(ii)独立地对操作化和测量这些属性,(iii)经验性地映射这些属性的变化如何影响行为的概率。主流的AI评估方法,从基准平均值到数据驱动的潜在变量模型如项目反应理论(IRT),完全绕过了这些步骤。基于哲学科学、测量理论和认知科学的想法,我们发展了一套关于AI能力和倾向作为 dispositions 的原则方法,阐明了为何主流评估实践无法测量这些 dispositions,并概述了什么样的 disposition-respecting、具有科学可信度的AI评估才需要。
关键词
引用
@article{arxiv.2603.00063,
title = {Measuring What AI Systems Might Do: Towards A Measurement Science in AI},
author = {Konstantinos Voudouris and Mirko Thalmann and Alex Kipnis and José Hernández-Orallo and Eric Schulz},
journal= {arXiv preprint arXiv:2603.00063},
year = {2026}
}