中文

BAMDP 塑形:内在动机与奖励塑形的统一框架

机器学习 2025-03-25 v2 人工智能

摘要

内在动机和奖励塑形通过添加伪奖励来引导强化学习 (RL) 智能体,这可以产生有用的涌现行为。然而,它们也可能鼓励适得其反的利用,例如,对嘈杂电视屏幕的沉迷。在此,我们提供了一个预测这些行为的理论模型,并给出了限制其不利影响的广泛标准。我们将所有伪奖励表征为贝叶斯自适应马尔可夫决策过程 (BAMDP) 中的奖励塑形,这将在 MDP 中学习的问题表述为关于智能体知识的 MDP。最优探索最大化 BAMDP 状态价值,我们将其分解为所收集信息的价值和物理状态的先验价值。伪奖励通过奖励增加这些价值分量的行为来引导 RL 智能体,而当它们与实际价值对齐不佳时,则会阻碍探索。我们将基于势能的塑形理论扩展,证明 BAMDP 势能塑形函数 (BAMPF) 在元强化学习 (meta-RL) 中对奖励黑客攻击(即为了最大化复合奖励而收敛于损害真实奖励的行为)免疫,并实证展示了 BAMPF 如何帮助元 RL 智能体为伯努利多臂赌博机领域学习最优 RL 算法。我们最终证明,具有有界单调递增势能的 BAMPF 在常规 RL 设置中也能抵抗奖励黑客攻击。我们表明,以此形式改造或设计新的伪奖励项是很直接的,并在 Mountain Car 环境中提供了实证演示。

关键词

引用

@article{arxiv.2409.05358,
  title  = {BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping},
  author = {Aly Lidayan and Michael Dennis and Stuart Russell},
  journal= {arXiv preprint arXiv:2409.05358},
  year   = {2025}
}

备注

Published at ICLR 2025