中文

蒸馊强化学习算法用于 in-context 模型基准规划

机器学习 2025-02-27 v1 人工智能

摘要

最近的研究表明,Transformer 能够通过模仿现有强化学习 (RL) 算法来执行 in-context 强化学习,从而实现无需参数更新即可对未见任务进行高效适应。然而,这些模型也继承了所模仿 RL 算法的次优行为。这一问题主要源于这些算法所采用的渐进更新规则。基于模型的规划提供了一条可行的解决方案,使模型能够在采取行动前模拟潜在结果,从而提供一种偏离次优行为的额外机制。我们提出的蒸馊用于 in-context 规划 (DICP) 是一种 in-context 模型基准 RL 框架,其中 Transformer 同时学习环境动力学并在 in-context 中改进策略。我们在各种离散和连续环境中对 DICP 进行评估,包括 Darkroom 变体和 Meta-World。我们的结果表明,DICP 在实现最佳性能方面优于基准方法,包括模型无关方法和现有的 meta-RL 方法,同时显著减少了环境交互次数。

关键词

引用

@article{arxiv.2502.19009,
  title  = {Distilling Reinforcement Learning Algorithms for In-Context Model-Based Planning},
  author = {Jaehyeon Son and Soochan Lee and Gunhee Kim},
  journal= {arXiv preprint arXiv:2502.19009},
  year   = {2025}
}

备注

ICLR 2025