中文

背包约束赌博机问题中的非单调资源利用

机器学习 2022-09-27 v1 数据结构与算法 机器学习

摘要

背包约束赌博机(BwK)是一种具有影响力的不确定性下序贯决策模型,其包含了资源消耗约束。在每一轮中,决策者观测到一个由奖励和非负资源消耗向量组成的结果,每种资源的预算按其消耗量递减。本文引入随机BwK问题的一个自然推广,允许非单调资源利用。在每一轮中,决策者观测到一个由奖励和资源漂移向量(可正、可负或为零)组成的结果,每种资源的预算按其漂移量递增。我们的主要结果是,当决策者知道真实结果分布时,一种马尔可夫决策过程(MDP)策略相对于线性规划(LP)松弛具有常数后悔值。在此基础上,我们开发了当决策者不知道真实结果分布时相对于同一LP松弛具有对数后悔值的学习算法。我们还给出了从BwK到我们模型的归约,表明我们的后悔界与现有结果相匹配。

关键词

引用

@article{arxiv.2209.12013,
  title  = {Non-monotonic Resource Utilization in the Bandits with Knapsacks Problem},
  author = {Raunak Kumar and Robert Kleinberg},
  journal= {arXiv preprint arXiv:2209.12013},
  year   = {2022}
}

备注

To appear in the Proceedings of the 36th Conference on Neural Information Processing Systems (NeurIPS 2022)