随机策略在信任视界内实现上下文强化学习
机器学习
2025-05-05 v3 人工智能
摘要
预训练基础模型展现出非凡的上下文学习性能,允许对预训练期间未遇到的新任务进行零样本泛化。在强化学习(RL)的情况下,当以自回归监督方式在决策问题上预训练基础模型时,便会出现上下文强化学习(ICRL)。然而,当前最先进的 ICRL 算法(如 Algorithm Distillation、Decision Pretrained Transformer 和 Decision Importance Transformer)对预训练数据集在源策略、上下文信息和动作标签方面提出了严格要求。值得注意的是,这些算法要么要求最优策略,要么要求所有预训练环境具有不同程度的训练良好的行为策略。这极大地阻碍了 ICRL 在现实场景中的应用,因为在现实场景中,为大量真实训练环境获取最优或训练良好的策略可能是难以实现的。为了克服这一挑战,我们引入了一种名为状态-动作蒸馏(SAD)的新方法,该方法允许仅由随机策略引导来生成有效的预训练数据集。具体而言,SAD 通过在信任视界内使用随机策略从整个状态和动作空间中蒸馏出优秀的状态-动作对,以此选择查询状态和相应的动作标签,然后在预训练期间继承经典的自回归监督机制。据我们所知,这是第一项在随机策略和随机上下文下实现有效 ICRL 的工作。我们还建立了对 SAD 可信度及其性能保证的定量分析。此外,我们在多个流行的 ICRL 基准环境中的实证结果表明,平均而言,SAD 在离线评估中的表现比最佳基线高出 236.3%,在在线评估中高出 135.2%。
引用
@article{arxiv.2410.19982,
title = {Random Policy Enables In-Context Reinforcement Learning within Trust Horizons},
author = {Weiqin Chen and Santiago Paternain},
journal= {arXiv preprint arXiv:2410.19982},
year = {2025}
}