中文

RAPid-Learn:一种用于处理开放世界环境中新奇事件的恢复学习框架

人工智能 2022-06-28 v1 机器学习

摘要

我们提出 RAPid-Learn:学习恢复并重新规划(Learning to Recover and Plan Again),一种混合规划与学习方法,以解决智能体环境中突发且意外变化(即新奇事件)的适应问题。RAPid-Learn 旨在动态制定并求解任务马尔可夫决策过程(MDPs)的修改,并能够利用领域知识学习由环境变化引起的任何新动态。它能够利用领域知识学习动作执行器,这些执行器可进一步用于解决执行阻塞,从而实现成功的规划执行。该新奇信息反映在其更新的领域模型中。我们通过在受 Minecraft 启发的网格世界环境中引入多种新奇事件来展示其有效性,并将我们的算法与文献中的迁移学习基线进行比较。我们的方法是(1)即使在存在多个新奇事件时也有效,(2)比迁移学习 RL 基线更具样本效率,以及(3)对不完整的模型信息具有鲁棒性,这与纯符号规划方法相反。

关键词

引用

@article{arxiv.2206.12493,
  title  = {RAPid-Learn: A Framework for Learning to Recover for Handling Novelties in Open-World Environments},
  author = {Shivam Goel and Yash Shukla and Vasanth Sarathy and Matthias Scheutz and Jivko Sinapov},
  journal= {arXiv preprint arXiv:2206.12493},
  year   = {2022}
}

备注

Proceedings of the IEEE Conference on Development and Learning (ICDL 2022)