资源受限在线部署下的离线强化学习
机器学习
2021-12-09 v2 人工智能
系统与控制
系统与控制
机器学习
摘要
离线强化学习用于在实时访问环境代价高昂或不可能实现的场景中训练策略。作为这些严苛条件的自然结果,智能体在采取动作前可能缺乏充分观测在线环境的资源。我们称这种情况为资源受限设定。这导致如下情形:可用的训练离线数据集可包含经过充分处理的特徵(使用强大的语言模型、图像模型、复杂传感器等),而在实际在线采取动作时这些特徵并不可用。这种脱节导致了离线 RL 中一个有趣且未被探索的问题:是否可能使用经过丰富处理的离线数据集来训练一个在在线环境中仅能访问较少特徵的策略?本工作中,我们引入并形式化了这一新颖的资源受限问题设定。我们凸显了使用完整离线数据集训练的策略与使用有限特徵训练的策略之间的性能差距。我们用一种策略迁移算法来解决该性能差距:首先使用特徵完全可用的离线数据集训练教师智能体,然后将此知识迁移至仅使用资源受限特徵的学生智能体。为更好捕捉该设定的挑战,我们提出一种数据收集流程:强化学习资源受限数据集(RC-D4RL)。我们在 RC-D4RL 与流行的 D4RL 基准上评估我们的迁移算法,并观察到相对于基线(无迁移的 TD3+BC)的一致改进。实验代码见 https://github.com/JayanthRR/RC-OfflineRL。
引用
@article{arxiv.2110.03165,
title = {Offline RL With Resource Constrained Online Deployment},
author = {Jayanth Reddy Regatti and Aniket Anand Deshmukh and Frank Cheng and Young Hun Jung and Abhishek Gupta and Urun Dogan},
journal= {arXiv preprint arXiv:2110.03165},
year = {2021}
}
备注
Added experiments on discrete control and real world datasets along with more analyses on continuous control tasks