中文

通过适应原则学习实现快速开放世界适应

人工智能 2023-12-19 v1 机器学习

摘要

新颖性适应是智能体根据环境变化调整其行为的能力。这是智能体的重要特征,使其能够在新颖或意外情况下继续有效运作,但仍然是深度强化学习(DRL)的关键挑战。为应对这一挑战,我们提出了一种简单而有效的新方法NAPPING(新颖性适应原则学习),使训练好的DRL智能体能够快速响应开放世界中的不同类别的新颖性。通过NAPPING,DRL智能体可以学习仅在必要时调整训练好的策略。它们可以快速泛化到类似的新颖情况,而不影响仍然有效的训练策略部分。为了展示NAPPING的效率和有效性,我们在四个奖励结构和任务类型不同的动作域上评估了我们的方法。这些域包括CartPole和MountainCar(经典控制)、CrossRoad(路径寻找)和AngryBirds(物理推理)。我们将NAPPING与CartPole、MountainCar和CrossRoad上的标准在线和微调DRL方法以及更复杂的AngryBirds域上的最新方法进行了比较。评估结果表明,通过我们提出的方法,DRL智能体可以在所有测试域中快速有效地适应各种新颖情况。

关键词

引用

@article{arxiv.2312.11138,
  title  = {Rapid Open-World Adaptation by Adaptation Principles Learning},
  author = {Cheng Xue and Ekaterina Nikonova and Peng Zhang and Jochen Renz},
  journal= {arXiv preprint arXiv:2312.11138},
  year   = {2023}
}