基于交互预算的离线到在线强化学习中的自适应策略选择与微调
机器学习
2026-05-07 v1 人工智能
摘要
在离线到在线强化学习 (O2O-RL)中,首先使用先前收集的数据集安全训练策略,然后通过有限的在线交互来进一步微调以适应特定任务。在典型的O2O-RL管道中,对候选策略进行离线策略评估 (OPE)或在线评估 (OE)。然后部署估计价值最高的策略并持续微调。然而,该方案存在两个主要问题。首先,OPE可能不可靠,仅凭这些估计来部署策略风险较大,而OE可能通过大量在线交互识别出可行的策略,却未能利用其进行微调。其二且更为关键的是,往往无法事先确定预训练的策略在部署后会否能通过微调获得改进,尤其是在非平稳环境下。因此,在许多实际场景中,依赖于单一部署策略的程序是不可行的。此外,粗糙地对所有候选策略进行彻底微调会违反交互预算限制,同样不可行。本文提出一种 novel 方法,用于在O2O-RL中的在线交互预算下进行自适应策略选择与微调。遵循标准管道,我们首先使用不同的离线RL算法和超参数训练一组候选策略;随后进行OPE以获得初始性能估计。接着基于其预测性能采用上置置信区间方法自适应选择并微调策略,从而高效利用在线交互。我们展示了该方法在各种基准测试中优于O2O-RL基线。
引用
@article{arxiv.2605.05123,
title = {Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning},
author = {Alper Kamil Bozkurt and Xiaoan Xu and Shangtong Zhang and Miroslav Pajic and Yuichi Motai},
journal= {arXiv preprint arXiv:2605.05123},
year = {2026}
}