中文

超越奖励反馈的纯探索:动作后上下文的作用

机器学习 2026-05-13 v2

摘要

我们引入了带有动作后上下文的最佳臂识别问题,这是一个在随机多臂老虎机环境和固定置信度设置下的新最佳臂识别问题。该问题解决了学习者在执行每个动作后,除了获得奖励外还会收到一个动作后上下文的场景。这个动作后上下文提供了额外的信息,可以显著促进决策过程。我们分析了两种不同类型的动作后上下文:(i)分离型,其中奖励仅取决于上下文;(ii)非分离型,其中奖励同时取决于动作和上下文。对于这两种情况,我们都推导出了样本复杂度的实例相关下界,并提出了渐近达到最优样本复杂度的算法。对于分离型设置,我们提出了一种称为G-tracking的新型采样规则,该规则利用上下文空间的几何形状直接跟踪上下文而非动作。对于非分离型设置,我们通过证明Track-and-Stop算法可以扩展到该设置来实现这一点。此外,在这两种设置中,我们从理论和实证上表明,忽略动作后上下文的算法是次优的。最后,我们的实证结果展示了我们的方法与现有技术相比的优势。

关键词

引用

@article{arxiv.2502.03061,
  title  = {Pure Exploration Beyond Reward Feedback: The Role of Post-Action Context},
  author = {Mohammad Shahverdikondori and Amir Mohammad Abouei and Alireza Rezaeimoghadam and Negar Kiyavash},
  journal= {arXiv preprint arXiv:2502.03061},
  year   = {2026}
}

备注

46 pages, 8 figures