面向离线组合强化学习的机器人操作数据集
机器学习
2024-07-16 v2 人工智能
机器人学
摘要
离线强化学习(RL)是一个有前景的方向,它允许 RL 智能体在大型数据集上预训练,避免昂贵数据收集的反复发生。为推动该领域发展,生成大规模数据集至关重要。组合 RL 尤其适于生成此类大数据集,因为 1)它可用少量组件创建许多任务,2)任务结构可使训练后的智能体通过组合相关已学组件来解决新任务,3)组合维度提供了一种任务相关性的概念。本文提供了使用来自 CompoSuite [Mendez at al., 2022a] 的 个任务创建的四个模拟机器人操作离线 RL 数据集。每个数据集由具有不同性能程度的智能体收集,包含 百万次转移。我们提供了用于评估智能体学习组合任务策略能力的训练与评测设定。我们的基准实验表明,当前离线 RL 方法能在一定程度上学习训练任务,且组合方法优于非组合方法。然而当前方法无法提取组合结构以泛化到未见过任务,凸显了离线组合 RL 未来研究的必要性。
引用
@article{arxiv.2307.07091,
title = {Robotic Manipulation Datasets for Offline Compositional Reinforcement Learning},
author = {Marcel Hussing and Jorge A. Mendez and Anisha Singrodia and Cassandra Kent and Eric Eaton},
journal= {arXiv preprint arXiv:2307.07091},
year = {2024}
}
备注
Published as a conference paper at the First Reinforcement Learning Conference (RLC)