中文

多频率下的离线强化学习

机器学习 2022-07-27 v1 人工智能 机器人学

摘要

利用多源离线机器人数据需要应对此类数据的异质性。本文关注异质性的一个特定方面:从不同控制频率收集的离线数据中学习。不同实验室中控制器的离散化、传感器的采样率以及感兴趣任务的需求可能不同,从而在聚合数据集中产生频率混合。我们研究离线强化学习(RL)算法在训练时能在多大程度上适应频率混合的数据。我们观察到QQ值以不同速率针对不同离散化传播,给现成的离线RL带来若干学习挑战。我们提出一种简单而有效的解决方案,强制QQ值更新速率的一致性以稳定学习。通过按离散化大小缩放NN步回报中的NN值,我们有效平衡QQ值传播,实现更稳定的收敛。在三个模拟机器人控制问题上,我们经验性地发现该简单方法比朴素混合平均高出50%。

关键词

引用

@article{arxiv.2207.13082,
  title  = {Offline Reinforcement Learning at Multiple Frequencies},
  author = {Kaylee Burns and Tianhe Yu and Chelsea Finn and Karol Hausman},
  journal= {arXiv preprint arXiv:2207.13082},
  year   = {2022}
}

备注

Project website: https://sites.google.com/stanford.edu/adaptive-nstep-returns/