改进 TD3-BC:面向离线学习的松弛策略约束与稳定在线微调
机器学习
2022-11-23 v1 人工智能
机器学习
摘要
从固定数据集中发现最优行为的能力,有潜力将强化学习(RL)的成功转移到数据收集极其困难的领域。在此离线设定中,一个关键挑战是克服对数据中未出现动作的高估偏差,若无法通过与环境的互动来纠正,该偏差会在训练中传播并放大,导致高度次优策略。减少此偏差的一个简单方法是通过行为克隆(BC)引入策略约束,鼓励智能体选择更接近源数据的动作。通过找到 RL 与 BC 之间的适当平衡,此类方法已被证明出奇有效,且只需对其所基于的基础算法做极小改动。迄今为止这种平衡一直保持恒定,但在本工作中我们探索在初始训练后将该平衡向 RL 倾斜的思路。使用 TD3-BC,我们证明通过继续离线训练策略同时降低 BC 组件的影响,可以产生优于原始基线、并匹配或超过更复杂替代方案性能的精炼策略。此外,我们证明这种方法可用于稳定的在线微调,允许在部署期间安全改进策略。
引用
@article{arxiv.2211.11802,
title = {Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning},
author = {Alex Beeson and Giovanni Montana},
journal= {arXiv preprint arXiv:2211.11802},
year = {2022}
}
备注
3rd Offline Reinforcement Learning Workshop at Neural Information Processing Systems, 2022