通过专家引导的对称性检测进行数据增强以改进离线强化学习性能
机器学习
2023-04-13 v3 人工智能
摘要
马尔可夫决策过程(MDP)动态模型的离线估计是一项非平凡任务,极大依赖于学习阶段可用的数据。有时模型的动态关于当前状态与动作的某些变换是不变的。近期工作表明,在确定性环境(包括离散与连续值)中,依赖密度估计方法(如基于深度神经网络的标准化流)的专家引导流程能有效检测此结构。所获知识可用于增强原始数据集,最终减小真实模型与所学模型之间的分布偏移。此类数据增强技术可用作采用离线强化学习架构之前的预处理过程,以提升其性能。本工作中我们将该范式扩展至非确定性 MDP,具体而言:1)我们提出离散环境中基于统计距离的 detection 阈值;2)我们表明前述结果在求解所学 MDP 并将优化策略应用于真实环境时带来性能提升。
引用
@article{arxiv.2112.09943,
title = {Data Augmentation through Expert-guided Symmetry Detection to Improve Performance in Offline Reinforcement Learning},
author = {Giorgio Angelotti and Nicolas Drougard and Caroline P. C. Chanel},
journal= {arXiv preprint arXiv:2112.09943},
year = {2023}
}
备注
Accepted at ICAART 2023