中文

CAR-DESPOT:面向混杂环境中机器人的因果知情在线POMDP规划

机器人学 2023-07-28 v3 人工智能 机器学习

摘要

在真实世界环境中运行的机器人必须推理随机行动的可能结果,并基于真实世界状态的部分观测做出决策。做出准确且鲁棒的行动预测的一个主要挑战是混杂问题,若不加处理会导致预测错误。部分可观测马尔可夫决策过程(POMDP)是建模此类随机且部分可观测决策问题的广泛使用的框架。然而,由于缺乏显式因果语义,POMDP规划方法易于受到混杂偏差影响,因此在存在未观测混杂因素时可能产生表现不佳的策略。本文提出了一种新颖的因果知情扩展,针对现代任意时刻在线POMDP规划器“任意时刻正则化确定性稀疏部分可观测树”(AR-DESPOT),利用因果建模与推断消除由未测量混杂变量引起的错误。我们进一步提出了一种从真值模型数据离线学习规划用因果模型部分参数化的方法。我们在一个具有未观测混杂因素的玩具问题上评估了我们的方法,表明所学因果模型高度准确,且我们的规划方法对混杂更鲁棒,并比AR-DESPOT产生整体性能更优的策略。

关键词

引用

@article{arxiv.2304.06848,
  title  = {CAR-DESPOT: Causally-Informed Online POMDP Planning for Robots in Confounded Environments},
  author = {Ricardo Cannizzaro and Lars Kunze},
  journal= {arXiv preprint arXiv:2304.06848},
  year   = {2023}
}

备注

8 pages, 3 figures, accepted to 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)