中文

组合_bandit 分配中群体的排序优先级划分

人工智能 2022-05-12 v1 计算机与社会 机器学习

摘要

通过巡护员巡逻防止偷猎可保护濒危野生动物,直接贡献于联合国可持续发展目标 15(陆地生命)。组合 bandit 已被用于分配有限的巡逻资源,但现有方法忽视了每个地点栖息着多种比例不同的物种这一事实,因此一次巡逻对各物种的受益程度不同。当某些物种更为脆弱时,我们理应给予这些动物更多保护;遗憾的是,现有组合 bandit 方法未提供对重要物种进行优先级排序的途径。为弥补这一缺口,(1)我们提出一种新颖的组合 bandit 目标,在奖励最大化的同时考虑物种间的优先级,称之为排序优先级(ranked prioritization)。我们证明该目标可表示为 Lipschitz 连续奖励函数的加权线性和。(2)我们提供 RankedCUCB 算法,用于选择优化该基于优先级目标的组合动作,并证明其达到渐近无遗憾(asymptotic no-regret)。(3)我们利用真实世界野生动物保护数据实证表明,RankedCUCB 使濒危物种的结果改善高达 38%。除适应其他挑战(如防止非法伐木和过度捕捞)外,我们的无遗憾算法解决了带加权线性目标的通用组合 bandit 问题。

关键词

引用

@article{arxiv.2205.05659,
  title  = {Ranked Prioritization of Groups in Combinatorial Bandit Allocation},
  author = {Lily Xu and Arpita Biswas and Fei Fang and Milind Tambe},
  journal= {arXiv preprint arXiv:2205.05659},
  year   = {2022}
}

备注

Accepted at IJCAI 2022, AI for Good track. 7 pages + 2 pages appendix. Code is available at https://github.com/lily-x/rankedCUCB