多频率下的离线强化学习
机器学习
2022-07-27 v1 人工智能
机器人学
摘要
利用多源离线机器人数据需要应对此类数据的异质性。本文关注异质性的一个特定方面:从不同控制频率收集的离线数据中学习。不同实验室中控制器的离散化、传感器的采样率以及感兴趣任务的需求可能不同,从而在聚合数据集中产生频率混合。我们研究离线强化学习(RL)算法在训练时能在多大程度上适应频率混合的数据。我们观察到值以不同速率针对不同离散化传播,给现成的离线RL带来若干学习挑战。我们提出一种简单而有效的解决方案,强制值更新速率的一致性以稳定学习。通过按离散化大小缩放步回报中的值,我们有效平衡值传播,实现更稳定的收敛。在三个模拟机器人控制问题上,我们经验性地发现该简单方法比朴素混合平均高出50%。
引用
@article{arxiv.2207.13082,
title = {Offline Reinforcement Learning at Multiple Frequencies},
author = {Kaylee Burns and Tianhe Yu and Chelsea Finn and Karol Hausman},
journal= {arXiv preprint arXiv:2207.13082},
year = {2022}
}
备注
Project website: https://sites.google.com/stanford.edu/adaptive-nstep-returns/