使用分层操作模型的审慎行动、在线规划与学习
摘要
在人工智能研究中,合成行动计划通常使用动作的描述性模型,这些模型抽象地指定动作可能导致的结果,并专为高效计算状态转移而定制。然而,执行已规划的动作需要操作模型,其中使用丰富的计算控制结构和闭环在线决策来指定如何在非确定性执行上下文中执行动作、对事件作出反应并适应不断展开的情况。集成行动与规划的审慎行动者通常需要同时使用这两种模型——这在试图开发不同模型、验证其一致性以及平滑交错行动与规划时会引发问题。作为替代,我们定义并实现了一种集成行动与规划系统,其中规划与行动使用相同的操作模型。这些模型依赖于提供丰富控制结构的分层面向任务精化方法。称为反应式行动引擎(RAE)的行动组件受到著名的PRS系统的启发。在每个决策步,RAE可从规划器获得关于效用函数的近最优选择的建议。该任意时间规划器使用称为UPOM的类似UCT的蒙特卡洛树搜索过程,其 rollout 是行动者操作模型的模拟。我们还提出了与RAE和UPOM一起使用的学习策略,其从在线行动经验和/或模拟规划结果中习得从决策上下文到方法实例的映射以及引导UPOM的启发式函数。我们证明了在静态域中UPOM对最优方法的渐近收敛性,并通过实验表明UPOM与学习策略显著提升了行动效率与鲁棒性。
引用
@article{arxiv.2010.01909,
title = {Deliberative Acting, Online Planning and Learning with Hierarchical Operational Models},
author = {Sunandita Patra and James Mason and Malik Ghallab and Dana Nau and Paolo Traverso},
journal= {arXiv preprint arXiv:2010.01909},
year = {2021}
}
备注
Published in Artificial Intelligence (AIJ). Please cite as: Sunandita Patra, James Mason, Malik Ghallab, Dana Nau, Paolo Traverso. Deliberative Acting, Planning and Learning with Hierarchical Operational Models. Artificial Intelligence, Elsevier, 2021, 299, pp.103523. 10.1016/j.artint.2021.103523. arXiv admin note: text overlap with arXiv:2003.03932