非随机线性部分监控的实例相关 regret 上界
机器学习
2026-01-15 v2
摘要
与经典部分监控公式化相比,线性部分监控可以建模无限的结果空间,同时对损失和观察都施加线性结构。该设置可视为线性 bandits 的一种推广,其中损失和反馈以灵活的方式解耦。在本文中,我们通过一种易于高效实现的探索-优化方法解决了该问题的非随机(对抗性)有限动作版本。我们推导的 regret 上界在解释游戏结构方面比以往该范例的理论保证更透明。我们的上界包含实例特定的量,这些量反映了观察值与损失之间对齐程度的高低,类似于随机设置中已知的保证。在显著的方面,它们在容易(局部可观测)游戏中实现标准的 速率,在困难(全局可观测)游戏中实现 速率,其中 为时间范围。我们在一些旧和新的部分信息设置中实现了这些上界,这些设置被本模型所包含,并说明所达成的对游戏结构的依赖性在有趣的案例中可能是紧致的。
引用
@article{arxiv.2510.19158,
title = {Instance-Dependent Regret Bounds for Nonstochastic Linear Partial Monitoring},
author = {Federico Di Gennaro and Khaled Eldowa and Nicolò Cesa-Bianchi},
journal= {arXiv preprint arXiv:2510.19158},
year = {2026}
}