强化学习中对新动作的泛化
机器学习
2020-11-04 v1 人工智能
机器人学
机器学习
摘要
智能的一个基本特征是在新环境下实现目标的能力,例如从新的动作选项中进行决策。然而,标准强化学习假设动作集合固定,并在给定新动作集时需要昂贵的重新训练。为使学习智能体更具适应性,我们提出了对新动作进行零样本泛化的问题。我们提出了一个两阶段框架,其中智能体首先从独立于任务获取的动作信息中推断动作表示,然后以泛化目标训练一个可适应不同动作集的策略。我们在序列任务上对所提出的泛化方法进行基准测试,例如从未见过的工具集中进行选择以解决物理推理谜题,以及用新颖的3D形状堆叠塔块。视频与代码可在 https://sites.google.com/view/action-generalization 获取。
引用
@article{arxiv.2011.01928,
title = {Generalization to New Actions in Reinforcement Learning},
author = {Ayush Jain and Andrew Szot and Joseph J. Lim},
journal= {arXiv preprint arXiv:2011.01928},
year = {2020}
}
备注
ICML 2020. Videos and code: https://sites.google.com/view/action-generalization