基于离散化状态策略的无动作离线-在线强化学习
机器学习
2026-02-03 v1 人工智能
机器学习
摘要
大多数现有离线强化学习方法假设数据集中可获得动作标签,但在许多实际场景中,由于隐私、存储或传感器限制,动作可能缺失。我们正式化了无动作离线-在线强化学习的设置,即智能体必须从仅包含 元组的数据集中学习,然后在在线交互中利用这方面的知识。为此,我们提出学习状态策略,这些策略会推荐可取的下一个状态转换,而非动作。我们的贡献有两个方面:首先,我们引入一种简单而新颖的状态离散化转换,提出Offline State-Only DecQN (\algo),这是一种针对从无动作数据中预训练状态策略的值基方法。\algo{}将该转换整合进来,能够高效处理高维问题,同时避免连续状态预测中常见的不稳定和过拟合问题。其次,我们提出了一种新型机制,用于引导在线学习,利用这些预训练的状态策略来加速在线智能体的学习。 Together,这些组件构成了一个可扩展且实用的框架,用于利用无动作数据集加速在线强化学习。跨多个基准的实验结果表明,我们的方法在收敛速度和渐近性能方面都有所提升,而分析则揭示,离散化和正则化对其有效性至关重要。
引用
@article{arxiv.2602.00629,
title = {Action-Free Offline-to-Online RL via Discretised State Policies},
author = {Natinael Solomon Neggatu and Jeremie Houssineau and Giovanni Montana},
journal= {arXiv preprint arXiv:2602.00629},
year = {2026}
}
备注
ICLR 2026