基于共享网络的自适应策略骨干
机器学习
2025-09-29 v1 人工智能
摘要
强化学习(RL)在多个领域取得了令人瞩目的成果,但学习最优策略通常需要大量的交互数据,限制了其实际部署。一种常见的补救方法是利用先验知识,例如预先收集的数据集或参考策略,但当训练与部署之间存在任务不匹配时,其效用会降低。尽管先前的工作试图解决这种不匹配问题,但大多局限于分布内设置。为应对这一挑战,我们提出了自适应策略骨干(APB),这是一种元迁移强化学习方法,在共享骨干网络前后插入轻量级线性层,从而在适应过程中实现参数高效微调(PEFT),同时保留先验知识。我们的结果表明,APB 相比标准 RL 提高了样本效率,并能适应现有元 RL 基线通常失败的分布外(OOD)任务。
引用
@article{arxiv.2509.22310,
title = {Adaptive Policy Backbone via Shared Network},
author = {Bumgeun Park and Donghwan Lee},
journal= {arXiv preprint arXiv:2509.22310},
year = {2025}
}