风险环境中跨多个时段的包裹投递规划
最优化与控制
2021-10-20 v1 离散数学
概率论
摘要
我们研究了一个风险感知的机器人规划问题,其中调度者必须构建一个包裹投递计划,以最大化机器人在多个时段内投递包裹的期望奖励。每个包裹都有相应的投递奖励和失败风险。如果机器人在投递某个包裹时失败,则无法投递任何未来的包裹,并且会产生更换机器人的成本。包裹投递计划在一个有限或无限数量的时段内进行,分别称为有限时段问题和无限时段问题。调度者必须权衡在任意给定时段内投递包裹的风险与奖励,以及任何未来时段奖励的潜在损失。通过使用包裹奖励与其失败风险之比,我们证明了有限和无限时段问题的最优贪心解。有限时段问题可以在 时间内最优求解,其中 是时段数, 是包裹数。我们展示了无限时段问题与马尔可夫决策过程(Markov Decision Processes)之间的同构,以证明无限时段问题的 时间最优算法。
引用
@article{arxiv.2110.09917,
title = {Planning for Package Deliveries in Risky Environments Over Multiple Epochs},
author = {Blake Wilson and Jeffrey Hudack and Shreyas Sundaram},
journal= {arXiv preprint arXiv:2110.09917},
year = {2021}
}