中文

使用约束动作空间强化学习求解在线威胁筛查博弈

计算机科学与博弈论 2019-11-21 v1 人工智能 机器学习

摘要

在机场、海港及其他入境口岸,利用有限筛查资源与能力对潜在威胁进行大规模筛查是一个受关注的问题。对手可观察筛查流程,并在因资源能力有限而出现筛查空档时抵达。为刻画港口与对手之间的这一博弈,该问题先前被表示为一种 Stackelberg 博弈,称为威胁筛查博弈(TSG)。鉴于求解 TSG 的显著复杂性及顾客到达的不确定性,已有工作假设被筛查者在时间窗开始时到达并分配安保资源。实践中,如机场乘客等被筛查者以与航班时间相关的突发方式到达,且不受固定时间窗约束。为此,我们提出一种在线威胁筛查模型,其中筛查策略在乘客到达时自适应确定,同时满足未筛查威胁可接受风险的硬界。为求解带风险硬界的在线问题,我们将其表述为动作空间受约束(风险硬界)的强化学习(RL)问题。我们提供了一种在深度强化学习中高效强制动作输出上线性不等式约束的新方法。我们表明,该方案能在保证风险界的同时显著减少被筛查者等待时间。

关键词

引用

@article{arxiv.1911.08799,
  title  = {Solving Online Threat Screening Games using Constrained Action Space Reinforcement Learning},
  author = {Sanket Shah and Arunesh Sinha and Pradeep Varakantham and Andrew Perrault and Milind Tambe},
  journal= {arXiv preprint arXiv:1911.08799},
  year   = {2019}
}

备注

Accepted to the Thirty-Fourth AAAI Conference on Artificial Intelligence (AAAI-20)