中文

充分利用你的一天:面向时间最优分配的在线学习

机器学习 2021-11-05 v2 机器学习 最优化与控制 其他统计学

摘要

我们研究当待分配资源为时间时的最优分配在线学习。应用示例包括计算服务器的作业调度、司机用行程填满一天、房东出租房产等。智能体依据泊松过程顺序接收任务提议,并可接受或拒绝所提议任务。若接受,则其在任务持续期间处于忙碌状态并获得取决于任务时长的奖励;若拒绝,则保持等待直至新任务提议到达。我们研究智能体产生的后悔值,首先考察其已知奖励函数但不知任务时长分布的情形,继而考察其亦不知奖励函数的情形。这一自然设定与上下文(单臂)bandit 相似,但关键区别在于与上下文相关的归一化奖励依赖于上下文的整体分布。

关键词

引用

@article{arxiv.2102.08087,
  title  = {Making the most of your day: online learning for optimal allocation of time},
  author = {Etienne Boursier and Tristan Garrec and Vianney Perchet and Marco Scarsini},
  journal= {arXiv preprint arXiv:2102.08087},
  year   = {2021}
}

备注

NeurIPS 2021 camera ready