中文

不完美的世界模型是可被利用的

人工智能 2026-05-19 v2 机器学习

摘要

我们为强化学习中的模型利用提出了一个新的定义。非正式地说,如果一个世界模型暗示某个策略应严格优于另一个策略,而环境的真实转移模型暗示相反,则该世界模型是可被利用的。我们将我们的定义与先前对奖励黑客行为的刻画进行了类比,但表明相关的必然性证明并不适用于利用。为了克服这一障碍,我们发展了奖励黑客和模型利用的一般理论,证明了利用在大型策略集上本质上是不可避免的,并得出黑客行为作为特例的相应结论。不幸的是,我们还发现,保证有限策略集不可黑客化的条件,没有对应的条件可以排除利用。因此,我们引入了一个宽松的利用概念,并推导出一个可以避免利用的安全时间范围。综上所述,我们的结果在奖励黑客和模型利用之间建立了形式化的桥梁,并阐明了在世界模型中进行安全规划的局限性。

关键词

引用

@article{arxiv.2605.15960,
  title  = {Imperfect World Models are Exploitable},
  author = {Logan Mondal Bhamidipaty and Esmeralda S. Whitammer and David Abel and Mykel J. Kochenderfer and Subramanian Ramamoorthy},
  journal= {arXiv preprint arXiv:2605.15960},
  year   = {2026}
}

备注

17 pages, 3 figures, 2 tables; modified (fixed metadata)