中文

针对对抗半bandit反馈的在线保守预测

机器学习 2026-04-21 v1 机器学习

摘要

不确定性量化在安全关键系统中至关重要,在这些系统中必须在不确定性下做出决策。特别是,我们考虑在线不确定性量化问题,即数据点按顺序到达。在线保守预测是一种原则性的在线不确定性量化方法,能够在每个时间步骤动态构建预测集合。虽然现有方法在没有任何分布性假设的情况下提供长期覆盖保证,但通常假设获得完全反馈,即始终观察真实标签。在本文中,我们提出一种新型学习方法,用于处理来自自适应对手的部分反馈的在线保守预测——这是一种更具挑战性的设置,即仅在预测集合内的真实标签才会显现。具体而言,我们将在线保守预测建模为对抗性bandit问题,将每个候选预测集合视为一个arm。基于现有对抗性bandit算法,我们的方法通过明确建立其与学习者regret的联系,实现长期覆盖保证。最终,我们在独立同分布(i.i.d.)和非i.i.d.设置中经验性地展示了该方法的有效性,表明它成功控制了miscoverage率,同时保持了合理的预测集合大小。

关键词

引用

@article{arxiv.2604.17984,
  title  = {Online Conformal Prediction with Adversarial Semi-bandit Feedback via Regret Minimization},
  author = {Junyoung Yang and Kyungmin Kim and Sangdon Park},
  journal= {arXiv preprint arXiv:2604.17984},
  year   = {2026}
}