中文

报酬评分的内生性:不可能性与在评分报告中的逃逸

计算机科学与博弈论 2026-05-11 v1 人工智能 多智能体系统 理论经济学 最优化与控制

摘要

从自主智能体中诱导真实报告是可扩展AI监督的核心问题:主体通过严格严谨的评分规则对智能体的报告进行评分,但该智能体还通过非准确性通道(如自主行动许可、分配份额、下游控制)获益。这种结构同样出现在经典机制设计设置中,如市场运营。我们的主要结果是内生性:主体的最优监督必然使用非仿射批准函数以筛选类型,但任何非仿射批准函数在deviation不可被察觉的情况下,使得诚实报告在组合目标下次优。主体无法避免削弱校准的扰动。这种不可能性适用于所有严格严谨的评分规则,给出闭形式扰动公式。存在构造性逃脱:阶梯函数批准阈值可实现每个严格严谨评分规则的第一最优筛选,因为智能体的二元inflate-or-not选择无论生成函数的曲率如何,都会创建类型空间阈值。针对Brier评分规则特别地,类型独立的inflate成本导致第二最优与第一最优之间的福利等价;我们证明这种等价是Brier唯一的(在光滑 C1C^1 监督下,其他非Brier规则的福利间隙被证明为 Ω(Var(1/G)(γ/β)2)\Omega(\text{Var}(1/G'') (\gamma/\beta)^2))。两个实例发展该框架:AI智能体监督(主要的激励领域)和市场运营(平行的机制设计领域)。AI对齐的讯息直接:基于光滑评分的监督无法从战略智能体中诱导真实报告;锋利阈值是校准保存的设计。

关键词

引用

@article{arxiv.2605.07671,
  title  = {The Endogeneity of Miscalibration: Impossibility and Escape in Scored Reporting},
  author = {Lauri Lovén and Sasu Tarkoma},
  journal= {arXiv preprint arXiv:2605.07671},
  year   = {2026}
}

备注

38 pages, no figures. Targeting ACM Transactions on Economics and Computation (TEAC); preprint