中文

带反馈图的纯探索

机器学习 2025-03-12 v1 机器学习

摘要

我们研究在具有反馈图的在线学习问题中的纯探索样本复杂度。该图决定了学习者可获得的反馈,涵盖了从完全信息、纯 bandit 反馈到无需对所选动作进行反馈的情形。尽管该问题的某些变体已被用于 regret 最小化,但目前尚无先前工作针对纯探索设置进行研究,这是本文的关注重点。我们推导了即使反馈图未知且为随机的,在以固定置信水平学习最佳动作时,样本复杂度的实例特定下界,并提出了针对伯努利奖励的不可识别性结果。此外,我们的发现揭示了样本复杂度如何随关键图依赖量的尺度而变化。最后,我们引入了 TaS-FG(Feedback Graphs 的 Track and Stop),一种渐近最优算法,并展示其在不同图配置下的效率。

关键词

引用

@article{arxiv.2503.07824,
  title  = {Pure Exploration with Feedback Graphs},
  author = {Alessio Russo and Yichen Song and Aldo Pacchiano},
  journal= {arXiv preprint arXiv:2503.07824},
  year   = {2025}
}