中文

后验行为克隆:用于高效 RL 微调的行为克隆预训练策略

机器学习 2025-12-19 v1 人工智能 机器人学

摘要

标准做法从机器人到语言等多个领域都是先在大规模演示数据集上预训练策略,然后通过微调(通常采用强化学习,RL)以提高在部署领域中的性能。这个微调步骤已被证明是实现人类或超人类性能的关键,但尽管已广泛关注 Developing more effective finetuning algorithms,却很少关注确保预训练策略是有效初始化以进行微调。本文旨在理解预训练策略如何影响微调性能,以及如何进行预训练以确保其是有效的初始化。我们首先表明,标准行为克隆(BC)——即训练策略直接匹配示范者所执行的动作——可能无法确保对示范者动作的覆盖,这是有效 RL 微调所必需的最小条件。随后我们表明,如果不完全拟合观察到的示范,而是训练策略来建模给定演示数据集后示范者行为的后验分布,我们便获得一个确保对示范者动作覆盖的策略,使微调更为有效。我们称该策略为后验行为克隆(PostBC)策略——它在确保预训练性能不逊于 BC 策略的同时实现动作覆盖。我们进一步表明,PostBC 可通过现代生成模型在机器人控制领域中实现,仅依赖标准监督学习,并在真实机器人控制基准和真实机器人操作任务上显著优于标准行为克隆。

关键词

引用

@article{arxiv.2512.16911,
  title  = {Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning},
  author = {Andrew Wagenmaker and Perry Dong and Raymond Tsao and Chelsea Finn and Sergey Levine},
  journal= {arXiv preprint arXiv:2512.16911},
  year   = {2025}
}