行为可信度三角困境:当自主性校准变得不可能时
机器学习
2026-05-26 v1 计算机科学与博弈论
机器学习
摘要
我们证明,当某些任务超出智能体可靠competence范围时,任何具备置信度门控自主性的强化学习政策都无法同时实现最大帮助性、最优校准和完全自主性——这就是行为可信度三角困境。这种不可能性是几何性的——将任何非仿射自主性激励添加到严格的评分规则中,就会破坏严格的适当性,从而使得在同时以校准置信度和自主行为为奖励的智能体在主语的批准阈值以下会系统性地高估其报告置信度。行为扰动引理量化了这种高估(对于 Brier 评分,比例为 ),并表明检测需要 次观察。我们证明,主语的最优监督规则必然是非仿射的,这使得这种不可能性在优化器独立的、以 log-凸密度为族的政策中都是不可避免的。我们形式化了置信度门控决策问题,将现有方法映射到三角困境中,并识别出两种建构性解决路径(承诺、域分离)。一项包含 540 种配置的最佳实验检验了五个预先登记的假设,所有假设都得到了强烈确认(效应大小 至 ),并添加了对可实现- 表面几何的描述性分析,显示出与预测一致的平台-截断前沿。
引用
@article{arxiv.2605.25739,
title = {The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible},
author = {Lauri Lovén and Nam Do and Hassan Mehmood and Dinesh Kumar Sah and Sasu Tarkoma},
journal= {arXiv preprint arXiv:2605.25739},
year = {2026}
}
备注
48 pages, 3 figures