中文

约束潜行动作策略用于基于模型的离线强化学习

机器学习 2025-12-16 v2 人工智能

摘要

在离线强化学习中,在缺乏来自环境的昂贵反馈的情况下,使用静态数据集学习策略。与在线设置相比,仅使用静态数据集会带来额外的挑战,例如策略生成分布外样本。基于模型的离线强化学习方法试图通过学习环境底层动力学的模型并利用其引导策略搜索来克服这些挑战。这是有益的,但在数据集有限的情况下,模型中的误差以及分布外状态的价值高估问题可能会恶化性能。当前的基于模型的方法对 Bellman 更新施加某种保守性,通常通过来自模型集成的不确定性估计来实现。在本文中,我们提出约束潜行动作策略(C-LAP),其学习观测与动作联合分布的生成模型。我们将策略学习表述为一个约束目标,使其始终保持在潜行动作分布的支持集内,并利用模型的生成能力对生成的动作施加隐式约束。从而消除了在 Bellman 更新上使用额外不确定性惩罚的需要,并显著减少了学习策略所需的梯度步数。我们在 D4RL 和 V-D4RL 基准上对 C-LAP 进行了实证评估,结果表明 C-LAP 与最先进方法具有竞争力,尤其在视觉观测数据集上表现更优。

关键词

引用

@article{arxiv.2411.04562,
  title  = {Constrained Latent Action Policies for Model-Based Offline Reinforcement Learning},
  author = {Marvin Alles and Philip Becker-Ehmck and Patrick van der Smagt and Maximilian Karl},
  journal= {arXiv preprint arXiv:2411.04562},
  year   = {2025}
}

备注

38th Conference on Neural Information Processing Systems (NeurIPS 2024)