等变离线强化学习
机器学习
2024-06-21 v1 机器人学
摘要
在将基于学习的方法应用于机器人操作时,样本效率至关重要,因为收集专家演示成本高昂,且通过在机器人上进行在线强化学习(RL)面临挑战。离线 RL 通过启用从任何行为策略(无论其质量如何)收集的离线数据集中进行策略学习,解决了这一问题。然而,近期在离线 RL 方面的进展主要聚焦于从大规模数据集中学习。鉴于许多机器人操作任务可表述为旋转对称问题,我们调查使用 -等变神经网络进行样本有限情况下的离线 RL。我们的实验结果表明,等变版本的保守 Q 学习(CQL)和隐式 Q 学习(IQL)优于其非等变对手等价方法。我们提供了实证证据,说明等变性如何在低数据 regime 中改进离线学习算法。
引用
@article{arxiv.2406.13961,
title = {Equivariant Offline Reinforcement Learning},
author = {Arsh Tangri and Ondrej Biza and Dian Wang and David Klee and Owen Howell and Robert Platt},
journal= {arXiv preprint arXiv:2406.13961},
year = {2024}
}