中文

过滤学习历史增强上下文强化学习

机器学习 2025-05-22 v1 机器人学

摘要

Transformer模型(TMs)展现了显著的上下文强化学习(ICRL)能力,使其能够在无需重新训练或微调的情况下泛化到先前未见过的环境中并加以改进。这通常通过模仿源RL算法在大量预训练环境中的完整学习历史来实现,但可能会传递源算法/数据集中继承的次优行为。因此,本工作从数据集预处理的角度解决次优性继承问题。受加权经验风险最小化成功的启发,我们提出了一种简单而有效的方法——学习历史过滤(LHF),通过根据其改进性和稳定性特征对学习历史进行重加权和过滤来增强ICRL。据我们所知,LHF是首个通过数据集预处理来避免源次优性的方法,可以与当前最先进的(SOTA)ICRL算法结合使用。我们通过一系列在知名ICRL基准上的实验验证了LHF的有效性,涵盖离散环境和连续机器人操控任务,以三种SOTA ICRL算法(AD、DPT、DICP)作为骨干网络。LHF在多种次优场景下表现出鲁棒性能,在不同超参数和采样策略下也表现稳健。值得注意的是,LHF的优越性能在存在噪声数据时更加明显,表明过滤学习历史的重要性。

关键词

引用

@article{arxiv.2505.15143,
  title  = {Filtering Learning Histories Enhances In-Context Reinforcement Learning},
  author = {Weiqin Chen and Xinjie Zhang and Dharmashankar Subramanian and Santiago Paternain},
  journal= {arXiv preprint arXiv:2505.15143},
  year   = {2025}
}