概率性任意时刻安全的随机组合半_bandit
机器学习
2023-06-05 v2 人工智能
信息论
math.IT
机器学习
摘要
出于对在线决策在每一步产生过度风险的担忧,本文提出了概率性任意时刻安全的随机组合半_bandit问题。在该问题中,智能体被允许从 个基础物品中选择一个大小至多为 的子集。每个物品关联一个特定均值奖励以及一个代表其风险的方差。为缓解智能体承担的风险,我们要求在以至少 的概率下,在整个时间跨度 内,智能体做出的每个选择所包含物品的方差之和不超过某一方差预算。我们称之为概率性任意时刻安全约束。在此约束下,我们设计并分析了算法{\sc PASCombUCB}以最小化时间跨度 内的后悔。通过构建伴随的信息论下界,我们证明了在问题相关与问题无关两种范式下,{\sc PASCombUCB}均几乎渐近最优。实验被用于证实我们的理论发现。我们的问题设定、提出的{\sc PASCombUCB}算法以及新颖的分析适用于推荐系统与交通等领域,其中智能体被允许在单一时间步选择多个物品并希望控制整个时间跨度的风险。
引用
@article{arxiv.2301.13393,
title = {Probably Anytime-Safe Stochastic Combinatorial Semi-Bandits},
author = {Yunlong Hou and Vincent Y. F. Tan and Zixin Zhong},
journal= {arXiv preprint arXiv:2301.13393},
year = {2023}
}
备注
To be presented at ICML 2023. 57 pages, 6 figures