中文

面向离线强化学习的上下文保守 Q 学习

机器学习 2023-01-18 v3 人工智能 机器人学

摘要

离线强化学习在离线数据集上学习有效策略而无需在线交互,因其潜在的实际应用价值而持续吸引研究关注。然而,由分布偏移产生的外推误差仍会导致对那些转移到分布外(OOD)状态的动作的高估,从而降低离线策略的可靠性和鲁棒性。在本文中,我们提出上下文保守 Q 学习(C-CQL),通过逆动力学模型捕获的上下文信息来学习鲁棒可靠的策略。在逆动力学模型的监督下,它倾向于学习一种在扰动状态下产生稳定转移的策略,因为扰动状态是一种常见的 OOD 状态。通过这种方式,我们使学习到的策略更可能产生注定指向离线数据集的经验下一状态分布的转移,即鲁棒可靠的转移。此外,我们从理论上揭示 C-CQL 是保守 Q 学习(CQL)和激进状态偏差校正(SDC)的推广。最后,实验结果表明所提出的 C-CQL 在离线 Mujoco 套件的大多数环境和噪声 Mujoco 设置中达到了最先进的性能。

关键词

引用

@article{arxiv.2301.01298,
  title  = {Contextual Conservative Q-Learning for Offline Reinforcement Learning},
  author = {Ke Jiang and Jiayu Yao and Xiaoyang Tan},
  journal= {arXiv preprint arXiv:2301.01298},
  year   = {2023}
}

备注

the work is not finished