中文

在导师的帮助下克服目标错误泛化

机器学习 2024-11-12 v3 人工智能

摘要

虽然强化学习智能体在训练期间通常表现良好,但在真实世界部署中可能会因分布偏移而遇到困难。分布偏移的一个特别严重的风险是目标错误泛化,即智能体学习到一个在训练期间与真实目标一致但在部署期间不一致的代理目标。在本文中,我们探讨了允许智能体在不熟悉的情况下向监督者请求帮助是否可以缓解这个问题。我们专注于在 CoinRun 环境中使用 PPO 训练的智能体,这是一个已知会表现出目标错误泛化的设置。我们评估了多种确定智能体何时应请求帮助的方法,并发现请求帮助能持续提高性能。然而,我们也发现基于智能体内部状态的方法无法主动请求帮助,而是等到错误已经发生后才请求。进一步的调查表明,智能体的内部状态根本没有表征硬币,这突显了学习细致入微表征的重要性、忽略与奖励不直接相关的一切的风险,以及开发针对智能体训练算法量身定制的请求帮助策略的必要性。

关键词

引用

@article{arxiv.2410.21052,
  title  = {Getting By Goal Misgeneralization With a Little Help From a Mentor},
  author = {Tu Trinh and Mohamad H. Danesh and Nguyen X. Khanh and Benjamin Plaut},
  journal= {arXiv preprint arXiv:2410.21052},
  year   = {2024}
}

备注

SATA Workshop @ NeurIPS 2024 (Towards Safe and Trustworthy Agents)