在图中寻找目标:序列搜索与停止
机器学习
2019-04-23 v3 机器学习
最优化与控制
摘要
我们考虑这样一个问题:一个智能体想要找到一个隐藏物体,该物体根据固定但可能未知的分布随机位于有向无环图(DAG)的某个顶点上。智能体只能检查其入邻居已被检查过的顶点。在本文中,我们研究一种学习设定,允许智能体在找到物体之前停止,并在同一问题的新独立实例上重新开始搜索。我们的目标是在给定时间预算下最大化找到的隐藏物体总数。因此,智能体在意识到某个实例会花费过多时间后可以跳过该实例。我们的贡献同时涉及搜索理论和多臂老虎机。如果分布已知,我们提供一种准最优且高效的平稳策略。如果分布未知,我们额外展示了如何序列地逼近它,同时以接近最优的方式行动,以收集尽可能多的隐藏物体。
引用
@article{arxiv.1806.02282,
title = {Finding the bandit in a graph: Sequential search-and-stop},
author = {Pierre Perrault and Vianney Perchet and Michal Valko},
journal= {arXiv preprint arXiv:1806.02282},
year = {2019}
}
备注
in International Conference on Artificial Intelligence and Statistics (AISTATS 2019), April 2019, Naha, Okinawa, Japan