基于简单序列先验的强化学习
机器学习
2023-05-29 v1
摘要
在其他条件相同的情况下,应优先选择较简单的模型而非复杂模型。在强化学习(RL)中,简单性通常按逐个动作的基础来量化——但这种时间尺度忽略了序列策略中常出现的时间规律性,例如重复。因此我们提出一种 RL 算法,学习用可压缩的动作序列来解决任务。我们探索了简单动作序列的两种可能来源:可由自回归模型学习的序列,以及可用现成数据压缩算法压缩的序列。将这些偏好提炼为序列先验,我们推导出一种新颖的信息论目标,激励智能体学习在最大化奖励的同时符合这些先验的策略。我们表明,在 DeepMind Control Suite 的一系列连续控制任务中,所得 RL 算法学习更快,并比最先进的免模型方法获得更高的回报。这些先验还产生了一个强大的信息正则化智能体,对噪声观测具有鲁棒性,并能执行开环控制。
引用
@article{arxiv.2305.17109,
title = {Reinforcement Learning with Simple Sequence Priors},
author = {Tankred Saanum and Noémi Éltető and Peter Dayan and Marcel Binz and Eric Schulz},
journal= {arXiv preprint arXiv:2305.17109},
year = {2023}
}