面向复杂环境的影响增强型在线规划
人工智能
2021-06-10 v2 机器学习
摘要
我们如何能够实时高效地规划以控制一个可能包含许多其他智能体的复杂环境中的智能体?尽管现有的基于采样的规划器在大型 POMDP 中取得了经验上的成功,但其性能严重依赖于快速的模拟器。然而,现实场景本质上复杂,其模拟器往往计算代价高昂,这严重限制了在线规划器的性能。在这项工作中,我们提出影响增强型在线规划(influence-augmented online planning),一种将整个环境的有因子分解模拟器转化为局部模拟器的原则性方法,该局部模拟器仅采样与规划智能体的观测和奖励最相关的状态变量,并使用机器学习方法捕获来自环境其余部分的传入影响。我们的主要实验结果表明,在此精度较低但速度快得多的局部模拟器上使用 POMCP 进行规划,比在建模整个环境的模拟器上规划具有更高的实时规划性能。
引用
@article{arxiv.2010.11038,
title = {Influence-Augmented Online Planning for Complex Environments},
author = {Jinke He and Miguel Suau and Frans A. Oliehoek},
journal= {arXiv preprint arXiv:2010.11038},
year = {2021}
}
备注
NeurIPS2020 - results have been updated after fixing minor bugs in the code