通过多步策略回归方法学习规划
机器学习
2021-06-21 v1 人工智能
机器人学
摘要
我们提出一种新方法,用于在需要特定动作序列才能求解的环境中提升推理性能。例如迷宫环境理想情况下需确定最优路径。我们不像单步学习策略那样,而是希望学习能提前预测 n 个动作的策略。我们提出的方法称为策略视野回归(PHR),利用 A2C 采样的环境知识,在策略蒸馏设置中学习 n 维策略向量,从而每次观测产生 n 个连续动作。我们在 MiniGrid 和 Pong 环境中测试该方法,并通过在单次观测上成功预测动作序列,展示了推理时间的显著加速。
引用
@article{arxiv.2106.10075,
title = {Learning to Plan via a Multi-Step Policy Regression Method},
author = {Stefan Wagner and Michael Janschek and Tobias Uelwer and Stefan Harmeling},
journal= {arXiv preprint arXiv:2106.10075},
year = {2021}
}
备注
Accepted at the 30th International Conference on Artificial Neural Networks (ICANN 2021)