中文

可靠性保障的序列建模下的基于模型的离线强化学习

机器学习 2025-05-06 v2 人工智能

摘要

基于模型的离线强化学习 (MORL) 旨在通过利用从现有数据集中推导出的动态模型来学习策略。将保守量化应用于动态模型,大多数现有 MORL 方法通过使用当前信息(例如状态和动作在时间步 tt 处的值)生成近似真实数据分布的轨迹,以便通过策略学习。然而,这些方法忽略了历史信息对环境动态的影响,导致生成不可靠的轨迹,这些轨迹可能不符合真实数据分布。本文提出了一种新的 MORL 算法 \textbf{R}eliability-guaranteed \textbf{T}ransformer (RT),通过计算生成轨迹的累积可靠性(即使用距离真实数据的加权变分距离)来消除不可靠的轨迹。此外,通过对具有高回报的候选动作进行采样,RT 可以高效地从现有的离线数据中生成高回报轨迹。我们在策略学习中理论证明了 RT 的性能保证,并在多个基准任务上经验性地展示了其对最先进模型方法的有效性。

关键词

引用

@article{arxiv.2502.06491,
  title  = {Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling},
  author = {Shenghong He},
  journal= {arXiv preprint arXiv:2502.06491},
  year   = {2025}
}