中文

基于模型的轨迹缝合用于改进离线强化学习

机器学习 2022-11-22 v1 机器学习

摘要

在许多现实应用中,收集大规模高质量数据集可能成本过高或不切实际。离线强化学习(RL)旨在从固定数据集中推断最优决策策略。一旦策略部署,从历史事件数据中获取最多信息对良好性能至关重要。我们提出一种基于模型的数据增强策略——轨迹缝合(TS),以改进次优历史轨迹的质量。TS 引入未见过的动作连接先前不相连的状态:利用状态可达性的概率概念,它有效地将历史演示的各部分“缝合”在一起以生成新的更高质量的演示。一次缝合事件包含通过合成且高概率动作在一对观测状态间的转移。仅当根据估计的状态值函数预期有益时,才引入新动作。我们表明,将该数据增强策略与行为克隆(BC)联合使用,相对于原始数据集上的行为克隆策略有所改进。改进 BC 策略可作为通过规划与演示引导 RL 进行在线 RL 的跳板。

关键词

引用

@article{arxiv.2211.11603,
  title  = {Model-based Trajectory Stitching for Improved Offline Reinforcement Learning},
  author = {Charles A. Hepburn and Giovanni Montana},
  journal= {arXiv preprint arXiv:2211.11603},
  year   = {2022}
}

备注

Offline RL Workshop at Neural Information Processing Systems, 2022