用于随机部分监测的随机化置信界
机器学习
2024-05-17 v2
摘要
部分监测 (PM) 框架为具有不完全反馈的序贯学习问题提供了理论表述。在每一轮中,学习智能体执行一个动作,而环境同时选择一个结果。然后,智能体观察到一个仅部分反映(未观察到的)结果的反馈信号。智能体利用接收到的反馈信号来选择动作,以最小化(未观察到的)累积损失。在上下文 PM 中,结果依赖于智能体在每轮选择动作前可观察到的某些辅助信息。本文中,我们考虑具有随机结果的上下文和非上下文 PM 设置。我们引入了一类基于确定性置信界随机化的新型 PM 策略。我们还将遗憾保证扩展到现有随机策略不适用的设置。我们的实验表明,所提出的 RandCBP 和 RandCBPsidestar 策略在多个 PM 博弈中相对于最先进的基线方法具有优越的性能。为倡导采用 PM 框架,我们针对监控任何已部署分类系统错误率的实际问题设计了一个用例。
引用
@article{arxiv.2402.05002,
title = {Randomized Confidence Bounds for Stochastic Partial Monitoring},
author = {Maxime Heuillet and Ola Ahmad and Audrey Durand},
journal= {arXiv preprint arXiv:2402.05002},
year = {2024}
}