中文

通过视觉重写规则学习可泛化行为

人工智能 2021-12-13 v1

摘要

尽管深度强化学习智能体近年来取得了前所未有的成功,它们学到的策略可能很脆弱,甚至无法泛化到环境的细微改动或陌生情形。神经网络学习过程的黑箱性质使得审计训练后的深度智能体并从中恢复变得不可能。本文提出一种新颖的表示与学习方法,在不使用神经网络的情况下捕捉环境动态。它源于如下观察:在为人类设计的游戏中,一个动作的效果常能以连续视觉观测中局部变化的形式被感知。我们的算法旨在提取此类基于视觉的变化,并将其浓缩为一组依赖于动作的描述性规则,我们称之为“视觉重写规则”(VRRs)。我们还展示了一个 VRR 智能体的初步结果,该智能体能够探索、扩展其规则集,并通过使用其学到的 VRR 世界模型进行规划来解决游戏。在若干经典游戏中,我们的非深度智能体相比几种主流深度智能体展现出更优的性能、极端的样本效率与鲁棒的泛化能力。

关键词

引用

@article{arxiv.2112.05218,
  title  = {Learning Generalizable Behavior via Visual Rewrite Rules},
  author = {Yiheng Xie and Mingxuan Li and Shangqun Yu and Michael Littman},
  journal= {arXiv preprint arXiv:2112.05218},
  year   = {2021}
}

备注

AAAI 2022 Workshop on Reinforcement Learning in Games