蒸馊强化学习算法用于 in-context 模型基准规划
机器学习
2025-02-27 v1 人工智能
摘要
最近的研究表明,Transformer 能够通过模仿现有强化学习 (RL) 算法来执行 in-context 强化学习,从而实现无需参数更新即可对未见任务进行高效适应。然而,这些模型也继承了所模仿 RL 算法的次优行为。这一问题主要源于这些算法所采用的渐进更新规则。基于模型的规划提供了一条可行的解决方案,使模型能够在采取行动前模拟潜在结果,从而提供一种偏离次优行为的额外机制。我们提出的蒸馊用于 in-context 规划 (DICP) 是一种 in-context 模型基准 RL 框架,其中 Transformer 同时学习环境动力学并在 in-context 中改进策略。我们在各种离散和连续环境中对 DICP 进行评估,包括 Darkroom 变体和 Meta-World。我们的结果表明,DICP 在实现最佳性能方面优于基准方法,包括模型无关方法和现有的 meta-RL 方法,同时显著减少了环境交互次数。
引用
@article{arxiv.2502.19009,
title = {Distilling Reinforcement Learning Algorithms for In-Context Model-Based Planning},
author = {Jaehyeon Son and Soochan Lee and Gunhee Kim},
journal= {arXiv preprint arXiv:2502.19009},
year = {2025}
}
备注
ICLR 2025