中文

强化学习,但请勿做我不会做的事

机器学习 2024-10-10 v1

摘要

在强化学习中,如果智能体的奖励与设计者的真实效用不同,即使只在极少数情况下发生,智能体策略导致的状态分布也可能在理论和实践中非常糟糕。当 RL 策略演化为不希望的行为时,常见的对策是对受信任策略进行 KL 正则化(“不要做我不会做的事”)。然而,我们展示了当该基础策略是受信任策略的贝叶斯预测模型时,KL 约束对于控制高级 RL 智能体的行为就不再可靠。我们使用算法信息论从理论上进行了证明,虽然当前系统还不足以精确呈现该理论预测的失败,但我们对语言模型进行 RL 微调,发现形式结果在实践中可能具有相关性。我们还提出了一种理论替代方案,通过将“不要做我不会做的事”原则替换为“不要做我可能不会做的事”,从而避免了此问题。

关键词

引用

@article{arxiv.2410.06213,
  title  = {RL, but don't do anything I wouldn't do},
  author = {Michael K. Cohen and Marcus Hutter and Yoshua Bengio and Stuart Russell},
  journal= {arXiv preprint arXiv:2410.06213},
  year   = {2024}
}

备注

10 pages, 7 page appendix, 4 figures