基于离线数据的强化学习中的时间抽象
机器学习
2024-07-23 v1
摘要
标准的强化学习算法采用单一策略,在面对稀疏奖励、多样化行为或长期规划的复杂环境任务时表现不佳。这促使研究者开发采用时间抽象、通过训练不同时间尺度上的策略层次来实现的算法。options框架被引入以实现这种时间抽象,通过学习作为扩展动作由高层策略控制的低层选项。将这些算法应用于实际问题的主要挑战在于,它们需要大量样本才能训练层次结构的多个层级,而在在线设置下难以实现。为此,本文提出一种从现有由其他未知智能体收集的离线数据集中学习选项的离线层次强化学习方法。这是一个极具挑战性的问题,由于所学习的选项与负责离线数据集的策略之间存在分布不匹配,并且据称是首个此方向的工作。在本工作中,我们提出一种框架,使可在离线数据集上训练的在线层次强化学习算法,该数据集包含由未知行为策略收集的转换。我们在Gym MuJoCo locomotion 环境和机器人夹取积木任务中进行了验证,包括标准设置、迁移和目标条件设置。
引用
@article{arxiv.2407.15241,
title = {Temporal Abstraction in Reinforcement Learning with Offline Data},
author = {Ranga Shaarad Ayyagari and Anurita Ghosh and Ambedkar Dukkipati},
journal= {arXiv preprint arXiv:2407.15241},
year = {2024}
}