具有时间随机约束的赌博机问题
机器学习
2020-06-23 v2 人工智能
机器学习
摘要
我们研究损伤效应对随机多臂赌博机的影响,并提出了缓解该效应的新方法。损伤效应是指智能体仅当在最近过去中至少执行过某动作若干次时才累积该动作的奖励这一现象。其实用动机来自广告(此处消费者行为可能要求广告商重复动作)和职业培训(此处动作为复杂技能,唯有通过重复才能掌握并获得回报)等领域的重复与近因效应。损伤可自然建模为策略空间上的时间约束,我们给出了两种实现次线性后悔的新算法,各自在不同的损伤效应假设下工作。我们在算法设计中引入了称为分桶(bucketing)的新概念,并展示其如何有效应对损伤及更广义的一类时间约束。我们的后悔界显式刻画了损伤代价,并表明其随损伤程度呈(次)线性缩放。我们的工作补充了近期关于建模延迟与损坏的研究,并提供了支持我们论断的实验证据。
引用
@article{arxiv.1811.09026,
title = {Bandits with Temporal Stochastic Constraints},
author = {Priyank Agrawal and Theja Tulabandhula},
journal= {arXiv preprint arXiv:1811.09026},
year = {2020}
}
备注
An extended abstract appeared in the 4th Multi-disciplinary Conference on Reinforcement Learning and Decision Making (RLDM 2019)