中文

风险环境中跨多个时段的包裹投递规划

最优化与控制 2021-10-20 v1 离散数学 概率论

摘要

我们研究了一个风险感知的机器人规划问题,其中调度者必须构建一个包裹投递计划,以最大化机器人在多个时段内投递包裹的期望奖励。每个包裹都有相应的投递奖励和失败风险。如果机器人在投递某个包裹时失败,则无法投递任何未来的包裹,并且会产生更换机器人的成本。包裹投递计划在一个有限或无限数量的时段内进行,分别称为有限时段问题和无限时段问题。调度者必须权衡在任意给定时段内投递包裹的风险与奖励,以及任何未来时段奖励的潜在损失。通过使用包裹奖励与其失败风险之比,我们证明了有限和无限时段问题的最优贪心解。有限时段问题可以在 O(Knlogn)O(K n\log n) 时间内最优求解,其中 KK 是时段数,nn 是包裹数。我们展示了无限时段问题与马尔可夫决策过程(Markov Decision Processes)之间的同构,以证明无限时段问题的 O(n)O(n) 时间最优算法。

关键词

引用

@article{arxiv.2110.09917,
  title  = {Planning for Package Deliveries in Risky Environments Over Multiple Epochs},
  author = {Blake Wilson and Jeffrey Hudack and Shreyas Sundaram},
  journal= {arXiv preprint arXiv:2110.09917},
  year   = {2021}
}