中文

通过学习识别少数关键状态实现通用策略评估与改进

机器学习 2022-07-05 v1 机器学习

摘要

学习评估并改进策略是强化学习(RL)的核心问题。传统 RL 算法学习为单一策略定义的价值函数。近来一种被探索的竞争性替代方案是为多种策略学习单一价值函数。在此,我们结合基于参数的价值函数的 actor-critic 架构与策略评估网络的策略嵌入,学习单一价值函数,用于评估(从而帮助改进)任何由深度神经网络(NN)表示的策略。该方法取得了有竞争力的实验结果。在具有无穷多状态的连续控制问题中,我们的价值函数通过同时学习一小部分“探测状态”以及从探测状态中产生的动作到策略回报的映射,来最小化其预测误差。该方法以极少数的、足以完全确定多种策略行为的状态形式,提取出关于环境的关键抽象知识。策略仅通过在探测状态中按照价值函数预测的梯度改变动作来改进。令人惊讶的是,在 Swimmer-v3 和 Hopper-v3 环境中,仅通过知道分别在 3 个和 5 个此类学习到的状态中如何动作,就能克隆近最优策略的行为。值得注意的是,我们训练用于评估 NN 策略的价值函数对策略架构的变化也不变:我们展示它允许零样本学习可与训练期间见到的最佳策略竞争的线性策略。我们的代码已公开。

关键词

引用

@article{arxiv.2207.01566,
  title  = {General Policy Evaluation and Improvement by Learning to Identify Few But Crucial States},
  author = {Francesco Faccio and Aditya Ramesh and Vincent Herrmann and Jean Harb and Jürgen Schmidhuber},
  journal= {arXiv preprint arXiv:2207.01566},
  year   = {2022}
}

备注

Preprint. Under review