中文

随机游走反馈下多臂老虎机的基本极限探究

机器学习 2022-06-28 v7

摘要

在本文中,我们考虑一种新的多臂老虎机(MAB)问题,其中臂是未知且可能变化的图中的节点,智能体(i)通过拉动臂在图上发起随机游走,(ii)观察随机游走轨迹,以及(iii)接收等于游走长度的奖励。我们通过研究随机和对抗两种设定,对该问题提供了全面的理解。我们表明,尽管通过随机游走轨迹可获得额外信息,该问题在信息论意义上并不比标准 MAB 更容易。本文还研究了 bandit 算法在该问题上的行为。

关键词

引用

@article{arxiv.2011.01445,
  title  = {Towards Fundamental Limits of Multi-armed Bandits with Random Walk Feedback},
  author = {Tianyu Wang and Lin F. Yang and Zizhuo Wang},
  journal= {arXiv preprint arXiv:2011.01445},
  year   = {2022}
}

备注

major revision