好奇心杀死或致残了猫与渐近最优智能体
机器学习
2021-05-27 v2 人工智能
摘要
强化学习智能体是学习选择导致高奖励动作的代理。理想情况下,强化学习智能体策略的价值趋近于最优——其中最优知情策略是使奖励最大化的策略。遗憾的是,我们证明如果一个智能体在任何(随机可计算)环境中被保证“渐近最优”,那么在关于真实环境的一个假设下,该智能体将以概率 1 被“摧毁”或“致残”。强化学习中的许多工作使用遍历性假设来避免此问题。通常,在简化假设下做理论研究能使我们即便在无这些假设时也能准备实际解决方案,但强化学习中的遍历性假设可能在为危险环境中的智能体准备安全有效的探索策略方面完全误导了我们。我们不是假设掉该问题,而是提出一个具有接近导师表现这一温和保证的智能体 Mentee,它进行安全探索而非鲁莽探索。关键在于,Mentee 的探索概率取决于探索的期望信息增益。在一个具有弱导师的简单非遍历环境中,我们发现 Mentee 优于现有的渐近最优智能体及其导师。
引用
@article{arxiv.2006.03357,
title = {Curiosity Killed or Incapacitated the Cat and the Asymptotically Optimal Agent},
author = {Michael K. Cohen and Elliot Catt and Marcus Hutter},
journal= {arXiv preprint arXiv:2006.03357},
year = {2021}
}
备注
13 pages, with 5 page appendix; 3 figures