推断行为特定上下文以提升强化学习中的零样本泛化能力
机器学习
2024-04-16 v1 人工智能
摘要
在这项工作中,我们探讨了强化学习(RL)中零样本泛化(ZSG)的挑战,即智能体必须在无需额外训练的情况下适应全新的环境。我们认为,理解并利用上下文线索(如环境的重力水平)对于稳健的泛化至关重要,并提议将上下文表示的学习直接与策略学习相结合。我们的算法在多个模拟领域展现出改进的泛化能力,在零样本设置中优于先前的上下文学习技术。通过联合学习策略和上下文,我们的方法获取了行为特定的上下文表示,从而能够适应未见过的环境,标志着向能够在多样化现实世界任务中泛化的强化学习系统迈出了进步。我们的代码和实验可在 https://github.com/tidiane-camaret/contextual_rl_zero_shot 获取。
引用
@article{arxiv.2404.09521,
title = {Inferring Behavior-Specific Context Improves Zero-Shot Generalization in Reinforcement Learning},
author = {Tidiane Camaret Ndir and André Biedenkapp and Noor Awad},
journal= {arXiv preprint arXiv:2404.09521},
year = {2024}
}
备注
https://github.com/tidiane-camaret/contextual_rl_zero_shot