中文

从次优历史数据中的基于情境的强化学习

机器学习 2026-01-29 v1

摘要

Transformer 模型由于其情境学习能力已取得了显著的经验成功。着手灵感由此引申,我们探索训练一种用于情境强化学习 (ICRL) 的自回归 transformer。在此设置下,我们首先在来自各种 RL 任务的轨迹组成的离线数据集上训练 transformer,然后固定并使用该 transformer 为新的 RL 任务创建动作策略。值得注意的是,我们考虑了离线数据集包含来自次优行为策略采样的轨迹的情况。在此情况下,标准自回归训练对应于模仿学习,导致次优性能。为此,我们提出了决策重要性 transformer (DIT) 框架,其在情境中模拟了 actor-critic 算法。具体而言,我们首先训练一个基于 transformer 的价值函数,以估计收集次优轨迹的行为策略的优势函数。然后我们通过加权最大似然估计损失训练基于 transformer 的策略,其中权重基于训练好的价值函数构建,以引导次优策略达到最优。我们对 DIT 在 bandit 和马尔可夫决策过程问题上的性能进行了广泛实验测试。我们的结果表明,DIT 在离线数据集包含次优历史数据时实现了优异的性能。

关键词

引用

@article{arxiv.2601.20116,
  title  = {In-Context Reinforcement Learning From Suboptimal Historical Data},
  author = {Juncheng Dong and Moyang Guo and Ethan X. Fang and Zhuoran Yang and Vahid Tarokh},
  journal= {arXiv preprint arXiv:2601.20116},
  year   = {2026}
}

备注

Accepted to Forty-Second International Conference on Machine Learning (ICML2025)