当策略无法重新训练时:离线强化学习中后训练驾驶的统一闭式视角
机器学习
2026-04-28 v1 人工智能
摘要
离线强化学习(RL)可以从固定数据集中学习有效策略,但部署目标在训练后可能发生变化,在许多应用中,训练好的行为策略无法重新训练,因为存在数据、成本或治理限制。我们研究针对冻结的离线行为者进行部署时适应的方法,使用基于概率的数学(PoE)与目标条件先验进行组合。我们的主要实用发现是优雅降解而非普遍性能提升:在退化或随机先验下,精度加权的组合保持对冻结行为者的锚定,而加法和仅使用先验的适应会崩溃,KL预算选择器常常能恢复接近 oracle 的运行点。我们还在冻结行为者情境下明确了一个闭式恒等式:对于对角高斯行为者和先验,PoE以系数 alpha 获得的确定性策略,等价于KL正则化适应,其中 beta = alpha / (1 - alpha),后验协方差仅相差一个全局标量因子。经验上,在4个 D4RL 环境(3900个 MuJoCo 演episode)中,我们观察到4/5/3的 HELP/FROZEN/HURT 比例。将分析扩展到6个更难的细胞和2个 AntMaze 诊断工具,揭示了行为者能力的上限:medium-expert 在所有9个细胞中在每个测试的 alpha 下始终处于 HURT 状态,而使用行为克隆的冻结行为者的 AntMaze 结果为零成功率,所有组合规则均如此。总体而言,PoE 和 KL 正则化适应可视为部署时驾驶的单一行为者锚定安全机制。
引用
@article{arxiv.2604.22873,
title = {When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning},
author = {Elias Hossain and Mohammad Jahid Ibna Basher and Ivan Garibay and Ozlem Garibay and Niloofar Yousefi},
journal= {arXiv preprint arXiv:2604.22873},
year = {2026}
}