通过激励与纠正实现 AI 对齐
机器学习
2026-05-12 v3 人工智能
摘要
我们从威慑与执法的法律经济学模型视角研究 AI 对齐。在这些模型中,违规不被视为外部失灵,而是一种对激励的策略性反应:行为者在权衡违规收益与被检测概率及惩罚严重程度之间进行权衡。我们认为,相同的逻辑自然地出现在智能 AI 管线中。求解器可能从生产有说服力但不正确的答案、隐藏不确定性或利用虚假捷径中获益,而审计员或验证者则必须决定是否值得进行昂贵的监控。因此,对齐成为一个固定点问题:更强的惩罚可能抑制求解器的不当行为,但也可能减少审计员的激励,因为此时审计主要针对的是看似越来越对齐的群体。这个视角也改变了应视为 post-training signal 的内容。标准反馈通常仅对最终答案赋予奖励,但求解器-审计员管线暴露了完整的纠正事件:求解器是否出错、审计员是否检查、错误是否被发现以及监督激励是否保持活跃。我们在两个代理模型中对此进行形式化建模,其中principal 选择针对联合纠正结果的奖励,从而诱导求解器行为和审计监控。奖励设计因此成为一个双层优化问题:奖励的评估不基于其立即的语义意义,而基于它们所诱导的行为均衡。我们提出了一个基于多臂赌博机的外环程序,用于通过噪声交互反馈搜索奖励配置。在一个 LLM 编码管线上的实验表明,遵循该方法所推荐的配置可维持有用的监督压力并提升 principal 对齐的结果,包括大幅减少幻觉式错误尝试的数量。
引用
@article{arxiv.2605.01643,
title = {AI Alignment via Incentives and Correction},
author = {Rohit Agarwal and Joshua Lin and Mark Braverman and Elad Hazan},
journal= {arXiv preprint arXiv:2605.01643},
year = {2026}
}