基于任意建议的策略不变实用塑造
机器学习
2020-11-04 v1 人工智能
摘要
强化学习是一种强大的学习范式,其中智能体可学习最大化稀疏且延迟的奖励信号。尽管 RL 在复杂领域取得诸多令人瞩目的成功,但学习可能耗费数小时、数天乃至数年的训练数据。当代 RL 研究的一大挑战是发现如何用更少的数据学习。先前工作表明,领域信息可成功用于塑造奖励;通过添加额外奖励信息,智能体可用少得多的数据学习。此外,若奖励由势函数构造,则最优策略保证不被改变。虽然此类基于势的奖励塑造(PBRS)大有前景,却受限于需要定义良好的势函数。理想情况下,我们希望能从人类或其他智能体获取任意建议并提升性能,且不影响最优策略。近期引入的动态基于势建议(DPBA)方法应对此挑战,它接受来自人类或其他智能体的任意建议,并在不影响最优策略的前提下提升性能。本文的主要贡献是从理论与实证上揭示 DPBA 的一个缺陷。作为替代,为实现理想目标,我们提出一种称为策略不变显式塑造(PIES)的简单方法,并从理论与实证上表明 PIES 在 DPBA 失败之处取得成功。
引用
@article{arxiv.2011.01297,
title = {Useful Policy Invariant Shaping from Arbitrary Advice},
author = {Paniz Behboudian and Yash Satsangi and Matthew E. Taylor and Anna Harutyunyan and Michael Bowling},
journal= {arXiv preprint arXiv:2011.01297},
year = {2020}
}
备注
9 pages, 6 figures, Adaptive and Learning Agents (ALA) 2020 Workshop