中文

基于行为克隆的Actor-Critic预训练用于近端策略优化

机器学习 2026-03-02 v1

摘要

强化学习(RL)Actor-Critic算法实现了自主学习,但往往需要大量环境交互,限制了其在机器人领域的应用。利用专家数据可减少所需的环境交互次数。常见做法是通过行为克隆在专家演示上初始化actor网络,然后通过RL进行微调。相较之下,Critic网络的初始化受到 insufficient 注意,尽管其在策略优化中扮演核心角色。本文提出一种针对Actor-Critic算法(如近端策略优化PPO)的预训练方法,使用专家演示为两个网络提供初始化。Actor通过行为克隆预训练,Critic则利用预训练策略的 rollout所得的回报进行预训练。该方法在15个模拟机器人操作和运动任务上进行评估。实验结果表明,与无预训练相比,Actor-Critic预训练平均提高了86.1%的样本效率,与仅进行Actor预训练相比,提高了30.9%。

关键词

引用

@article{arxiv.2602.23804,
  title  = {Actor-Critic Pretraining for Proximal Policy Optimization},
  author = {Andreas Kernbach and Amr Elsheikh and Nicolas Grupp and René Nagel and Marco F. Huber},
  journal= {arXiv preprint arXiv:2602.23804},
  year   = {2026}
}