中文

从噪声蒸馏中涌现的上下文强化学习

机器学习 2024-06-13 v3

摘要

近期,强化学习中关于 Transformer 适应各种环境和任务的上下文能力进行了广泛研究。当前的上下文 RL 方法受限于对数据的严格要求,这些数据需要由 RL 智能体生成或用来自最优策略的动作进行标注。为了解决这一普遍问题,我们提出了 ADε^\varepsilon,一种新的数据获取方法,使得从噪声诱导的课程中进行上下文强化学习成为可能。我们表明,构建合成的噪声注入课程以帮助获取学习历史是可行的。此外,我们通过实验证明,有可能缓解使用最优策略进行生成的需求,且上下文 RL 仍能在学习数据集中以 2 倍的优势超越最佳次优策略。

关键词

引用

@article{arxiv.2312.12275,
  title  = {Emergence of In-Context Reinforcement Learning from Noise Distillation},
  author = {Ilya Zisman and Vladislav Kurenkov and Alexander Nikulin and Viacheslav Sinii and Sergey Kolesnikov},
  journal= {arXiv preprint arXiv:2312.12275},
  year   = {2024}
}

备注

Proceedings of the 41-st International Conference on Machine Learning (ICML 2024); code: https://github.com/corl-team/ad-eps