MONA:非短视批准下的短视优化可缓解多步奖励欺骗
机器学习
2025-04-11 v2 人工智能
摘要
未来的高级人工智能系统可能会通过强化学习(RL)学到人类无法充分理解以至无法安全评估的复杂策略。我们提出了一种训练方法,即使人类无法检测到该行为是不期望的,该方法也能避免智能体学习到获得高奖励的不期望的多步计划(多步“奖励欺骗”)。该方法称为非短视批准下的短视优化(MONA),通过将短视优化与远视奖励相结合来工作。我们证明,MONA 可以防止普通强化学习导致的多步奖励欺骗,即使它无法检测到奖励欺骗,且没有获取普通强化学习无法访问的任何额外信息。我们在三种设定下对 MONA 进行了实证研究,这些设定模拟了不同的错位失败模式,包括以 LLM 代表委托监督和编码推理的 2 步环境,以及代表传感器篡改的更长视野的网格世界环境。
引用
@article{arxiv.2501.13011,
title = {MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking},
author = {Sebastian Farquhar and Vikrant Varma and David Lindner and David Elson and Caleb Biddulph and Ian Goodfellow and Rohin Shah},
journal= {arXiv preprint arXiv:2501.13011},
year = {2025}
}