从对称性中学习:基于对称行为与语言指令的元强化学习
人工智能
2023-07-06 v2
摘要
元强化学习(meta-RL)是一种使智能体快速学习新任务的有前景的方法。然而,大多数元强化学习算法由于仅由奖励提供的任务信息不足,在多任务场景中表现出较差的泛化能力。语言条件元强化学习通过将语言指令与智能体的行为相匹配来提升泛化能力。而行为与语言指令均具有对称性,可加速人类对新知识的学习。因此,将对称性与语言指令结合进元强化学习有助于提升算法的泛化与学习效率。我们提出一种双 MDP 元强化学习方法,能够利用对称行为与语言指令高效学习新任务。我们在多个具有挑战性的操作任务中评估了我们的方法,实验结果表明我们的方法能大幅改善元强化学习的泛化与学习效率。视频见 https://tumi6robot.wixsite.com/symmetry/。
引用
@article{arxiv.2209.10656,
title = {Learning from Symmetry: Meta-Reinforcement Learning with Symmetrical Behaviors and Language Instructions},
author = {Xiangtong Yao and Zhenshan Bing and Genghang Zhuang and Kejia Chen and Hongkuan Zhou and Kai Huang and Alois Knoll},
journal= {arXiv preprint arXiv:2209.10656},
year = {2023}
}