周界监视问题的自适应策略
机器学习
2019-11-12 v2 机器学习
摘要
最大化入侵检测是周界监视的一个基本且通常至关重要的目标。通常,这需要决策者将多个搜索者最优地分配到周界的各个区段。我们考虑这样一种场景:决策者可以顺序更新搜索者的分配,从观测数据中学习以随时间改进决策。在这项工作中,我们为这一顺序周界监视问题提出了形式化模型与求解方法。我们的模型是一个具有泊松奖励和一种新颖的过滤反馈机制的组合多臂老虎机(CMAB)——该机制源于对某些入侵的未能检测。我们的求解方法是上置信界方法,并推导了其期望性能的上界与下界。我们证明这些界之间的差距为常数阶,并通过实验证明在模拟问题中我们的方法比竞争算法更可靠。
引用
@article{arxiv.1810.02176,
title = {Adaptive Policies for Perimeter Surveillance Problems},
author = {James A. Grant and David S. Leslie and Kevin Glazebrook and Roberto Szechtman and Adam N. Letchford},
journal= {arXiv preprint arXiv:1810.02176},
year = {2019}
}