中文

等变离线强化学习

机器学习 2024-06-21 v1 机器人学

摘要

在将基于学习的方法应用于机器人操作时,样本效率至关重要,因为收集专家演示成本高昂,且通过在机器人上进行在线强化学习(RL)面临挑战。离线 RL 通过启用从任何行为策略(无论其质量如何)收集的离线数据集中进行策略学习,解决了这一问题。然而,近期在离线 RL 方面的进展主要聚焦于从大规模数据集中学习。鉴于许多机器人操作任务可表述为旋转对称问题,我们调查使用 SO(2)SO(2)-等变神经网络进行样本有限情况下的离线 RL。我们的实验结果表明,等变版本的保守 Q 学习(CQL)和隐式 Q 学习(IQL)优于其非等变对手等价方法。我们提供了实证证据,说明等变性如何在低数据 regime 中改进离线学习算法。

关键词

引用

@article{arxiv.2406.13961,
  title  = {Equivariant Offline Reinforcement Learning},
  author = {Arsh Tangri and Ondrej Biza and Dian Wang and David Klee and Owen Howell and Robert Platt},
  journal= {arXiv preprint arXiv:2406.13961},
  year   = {2024}
}