报酬评分的内生性:不可能性与在评分报告中的逃逸
计算机科学与博弈论
2026-05-11 v1 人工智能
多智能体系统
理论经济学
最优化与控制
摘要
从自主智能体中诱导真实报告是可扩展AI监督的核心问题:主体通过严格严谨的评分规则对智能体的报告进行评分,但该智能体还通过非准确性通道(如自主行动许可、分配份额、下游控制)获益。这种结构同样出现在经典机制设计设置中,如市场运营。我们的主要结果是内生性:主体的最优监督必然使用非仿射批准函数以筛选类型,但任何非仿射批准函数在deviation不可被察觉的情况下,使得诚实报告在组合目标下次优。主体无法避免削弱校准的扰动。这种不可能性适用于所有严格严谨的评分规则,给出闭形式扰动公式。存在构造性逃脱:阶梯函数批准阈值可实现每个严格严谨评分规则的第一最优筛选,因为智能体的二元inflate-or-not选择无论生成函数的曲率如何,都会创建类型空间阈值。针对Brier评分规则特别地,类型独立的inflate成本导致第二最优与第一最优之间的福利等价;我们证明这种等价是Brier唯一的(在光滑 监督下,其他非Brier规则的福利间隙被证明为 )。两个实例发展该框架:AI智能体监督(主要的激励领域)和市场运营(平行的机制设计领域)。AI对齐的讯息直接:基于光滑评分的监督无法从战略智能体中诱导真实报告;锋利阈值是校准保存的设计。
引用
@article{arxiv.2605.07671,
title = {The Endogeneity of Miscalibration: Impossibility and Escape in Scored Reporting},
author = {Lauri Lovén and Sasu Tarkoma},
journal= {arXiv preprint arXiv:2605.07671},
year = {2026}
}
备注
38 pages, no figures. Targeting ACM Transactions on Economics and Computation (TEAC); preprint