面向离线强化学习的反事实预算分配
机器学习
2024-05-22 v2 人工智能
摘要
在数据受限的离线强化学习中,主要挑战源于潜在动作领域内一系列反事实推理困境:如果我们选择不同的动作会怎样?此类情形常引发外推误差,并随问题步长呈指数级累积。因此,必须认识到并非所有决策步对最终结果同等重要,并对策略所作反事实决策的数量进行预算以控制外推。与现有对策略或价值函数使用正则化的方法不同,我们提出一种在训练期间显式约束分布外动作数量的方法。具体而言,我们的方法利用动态规划来决定何处外推、何处不外推,并对异于行为策略的决策数量设定上界。它在采取分布外动作带来的改进潜力与因外推产生误差的风险间取得平衡。理论上,我们以 更新规则不动点解的约束最优性证明了方法的合理性。在实验上,我们表明在广泛使用的 D4RL 基准任务中,我们方法的整体性能优于最先进的离线 RL 方法。
引用
@article{arxiv.2307.06328,
title = {Budgeting Counterfactual for Offline RL},
author = {Yao Liu and Pratik Chaudhari and Rasool Fakoor},
journal= {arXiv preprint arXiv:2307.06328},
year = {2024}
}
备注
Published at NeurIPS 2023