我在此能做什么?强化学习中的可供性理论
机器学习
2020-06-29 v1 人工智能
机器学习
摘要
强化学习算法通常假设所有动作始终对智能体可用。然而,人与动物都理解其环境特征与可行动作之间的普遍联系。Gibson(1977)创造了术语“affordances(可供性)”来描述某些状态使智能体能够执行某些动作这一事实,其背景为具身智能体。在本文中,我们为在马尔可夫决策过程中学习与规划的智能体发展了一种可供性理论。在此情形下可供性扮演双重角色。一方面,它们通过减少任一给定情形下可用动作的数量来实现更快规划。另一方面,它们促进从数据中对转移模型更高效且更精确的学习,尤其当此类模型需要函数逼近时。我们通过理论结果以及说明性例子确立了这些性质。我们还提出了一种学习可供性的方法,并用其估计更简单且泛化更好的转移模型。
引用
@article{arxiv.2006.15085,
title = {What can I do here? A Theory of Affordances in Reinforcement Learning},
author = {Khimya Khetarpal and Zafarali Ahmed and Gheorghe Comanici and David Abel and Doina Precup},
journal= {arXiv preprint arXiv:2006.15085},
year = {2020}
}
备注
Thirty-seventh International Conference on Machine Learning (ICML 2020)