中文

BATS:最优动作轨迹拼接

机器学习 2022-04-27 v1

摘要

离线强化学习的问题聚焦于从环境交互日志中学习一个良好策略。以往该领域算法开发的努力围绕对在线强化学习算法引入约束,以确保所学策略的动作受限于日志数据。在本工作中,我们探索一种替代方法:直接在固定数据集上规划。具体而言,我们引入一种算法,通过向数据集中添加新转移,在日志数据上构成一个表格型马尔可夫决策过程(MDP)。我们通过使用学习的动力学模型在状态间规划短轨迹来实现这一点。由于可对该构造的MDP执行精确值迭代,识别哪些轨迹有利于加入MDP变得容易。关键在于,由于该MDP中多数转移来自日志数据,来自MDP的轨迹可长时间可靠地展开。我们证明该性质允许人们在适当的度量下对值函数给出上下界。最后,我们通过实验展示均匀将所学策略约束于整个数据集的算法如何导致不期望的行为,并给出一个示例,其中简单地行为克隆我们算法所创MDP的最优策略可避免该问题。

关键词

引用

@article{arxiv.2204.12026,
  title  = {BATS: Best Action Trajectory Stitching},
  author = {Ian Char and Viraj Mehta and Adam Villaflor and John M. Dolan and Jeff Schneider},
  journal= {arXiv preprint arXiv:2204.12026},
  year   = {2022}
}

备注

Accepted to NeurIPS Offline RL Workshop 2021