中文

双重任务巡逻:面向绿色安全的多臂老虎机方法

机器学习 2024-04-29 v3 机器学习

摘要

在绿色安全领域保护野生动物和森林的保护工作受到防御者(即巡逻人员)数量有限的制约,他们必须在广阔区域巡逻以防攻击者(例如偷猎者或非法伐木者)。防御者必须选择在每个保护区区域花费多少时间,平衡对鲜少访问区域的探索与对已知热点的利用。我们将该问题表述为随机多臂老虎机,其中每个动作代表一种巡逻策略,使我们能够保证巡逻策略的收敛速率。然而,朴素的老虎机方法会为长期最优性而牺牲短期性能,导致动物被偷猎、森林被毁。为加快性能,我们利用奖励函数的光滑性与动作的可分解性。我们展示了 Lipschitz 连续性与分解之间的协同作用,因为二者互相促进对方的收敛。在此过程中,我们弥合了组合老虎机与 Lipschitz 老虎机之间的鸿沟,提出了一种无遗憾方法,在优化短期性能的同时收紧了现有保证。我们证明我们的算法 LIZARD 在来自柬埔寨的真实偷猎数据上提升了性能。

关键词

引用

@article{arxiv.2009.06560,
  title  = {Dual-Mandate Patrols: Multi-Armed Bandits for Green Security},
  author = {Lily Xu and Elizabeth Bondi and Fei Fang and Andrew Perrault and Kai Wang and Milind Tambe},
  journal= {arXiv preprint arXiv:2009.06560},
  year   = {2024}
}

备注

Published at AAAI 2021. 9 pages (paper and references), 3 page appendix. 6 figures and 1 table