上下文观测不完美下 Bandit 中贪婪策略的最坏情况性能
机器学习
2022-05-27 v2 机器学习
摘要
上下文 bandit 是随时间变化环境中不确定性下序贯决策的典型模型。在该设定中,每个 bandit 臂的期望收益由未知参数与该臂上下文向量的内积构成。经典 bandit 设定严重依赖上下文被完全观测的假设,而对观测不完美的上下文 bandit 这一更丰富模型的研究尚不成熟。本工作考虑贪婪强化学习策略,其采取动作时仿佛当前对参数及未观测上下文的估计与相应真值一致。我们确立非渐近最坏情况 regret 随时间长程与失败概率呈多对数增长,而随臂的数量线性缩放。文中还提供了展现上述贪婪策略效率的数值分析。
引用
@article{arxiv.2204.04773,
title = {Worst-case Performance of Greedy Policies in Bandits with Imperfect Context Observations},
author = {Hongju Park and Mohamad Kazem Shirani Faradonbeh},
journal= {arXiv preprint arXiv:2204.04773},
year = {2022}
}
备注
14 pages, 2figures