随机游走反馈下多臂老虎机的基本极限探究
机器学习
2022-06-28 v7
摘要
在本文中,我们考虑一种新的多臂老虎机(MAB)问题,其中臂是未知且可能变化的图中的节点,智能体(i)通过拉动臂在图上发起随机游走,(ii)观察随机游走轨迹,以及(iii)接收等于游走长度的奖励。我们通过研究随机和对抗两种设定,对该问题提供了全面的理解。我们表明,尽管通过随机游走轨迹可获得额外信息,该问题在信息论意义上并不比标准 MAB 更容易。本文还研究了 bandit 算法在该问题上的行为。
引用
@article{arxiv.2011.01445,
title = {Towards Fundamental Limits of Multi-armed Bandits with Random Walk Feedback},
author = {Tianyu Wang and Lin F. Yang and Zizhuo Wang},
journal= {arXiv preprint arXiv:2011.01445},
year = {2022}
}
备注
major revision