中文

Cal-QL:用于高效在线微调的校准离线 RL 预训练

机器学习 2024-01-23 v4 人工智能

摘要

离线强化学习(RL)的一个引人注目的用例是从已有数据集获得策略初始化,随后利用有限交互进行快速在线微调。然而,现有离线 RL 方法在微调时往往表现不佳。在本文中,我们设计了一种从离线数据学习有效初始化并同时具备快速在线微调能力的方法。我们的方法,校准 Q 学习(Cal-QL),通过学习一个保守的价值函数初始化来实现这一点,该初始化低估了从离线数据学到的策略的价值,同时又经过校准,即所学 Q 值处于合理尺度。我们称此性质为校准,并将其形式化定义为:为所学策略的真实价值函数提供下界,并为某个其他(次优)参考策略(可简单为行为策略)的价值提供上界。我们证明,学习此类校准价值函数的离线 RL 算法可带来有效的在线微调,使我们能在在线微调中获益于离线初始化。在实践中,Cal-QL 可在保守 Q 学习(CQL)离线 RL 方法之上以一行代码修改实现。在经验上,Cal-QL 在我们本文研究的 9/11 个微调基准任务上优于最先进方法。代码与视频见 https://nakamotoo.github.io/Cal-QL

关键词

引用

@article{arxiv.2303.05479,
  title  = {Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning},
  author = {Mitsuhiko Nakamoto and Yuexiang Zhai and Anikait Singh and Max Sobol Mark and Yi Ma and Chelsea Finn and Aviral Kumar and Sergey Levine},
  journal= {arXiv preprint arXiv:2303.05479},
  year   = {2024}
}

备注

NeurIPS 2023. project page: https://nakamotoo.github.io/Cal-QL