基于迭代局部搜索的程序化策略提取
人工智能
2022-01-19 v1
摘要
强化学习策略通常由神经网络表示,但在某些情况下程序化策略更受青睐,因为它们更具可解释性、易于形式化验证或具有更好的泛化能力。尽管存在学习神经策略的高效算法,学习程序化策略仍具挑战性。我们将模仿投影与数据集聚合结合局部搜索启发式方法,提出了一种从预训练神经策略中提取程序化策略的简单直接方法。在编程示例问题上检验我们的局部搜索启发式后,我们在摆杆起摆问题上展示了我们的程序化策略提取方法。无论是使用手工设计的专家策略还是学习得到的神经策略进行训练,我们的方法都能发现几乎与原始策略性能相当的简单且可解释的策略。
引用
@article{arxiv.2201.06863,
title = {Programmatic Policy Extraction by Iterative Local Search},
author = {Rasmus Larsen and Mikkel Nørgaard Schmidt},
journal= {arXiv preprint arXiv:2201.06863},
year = {2022}
}