中文

隐变量老虎机中的信息收集

机器学习 2022-07-11 v1

摘要

在隐变量老虎机问题中,学习者可以访问奖励分布,并且——对于非平稳变体——还可以访问环境的转移模型。奖励分布以臂和未知的隐状态为条件。目标是通过奖励历史来识别隐状态,从而在未来最优地选择臂。隐变量老虎机设定适用于许多实际应用,例如推荐系统和决策支持系统,其中丰富的数据允许离线估计环境模型,而在线学习仍是一个关键组成部分。该设定下的先前解法总是根据智能体对状态的信念选择最高奖励的臂,并未显式考虑信息收集臂的价值。此类信息收集臂不一定提供最高奖励,因此可能永远不会被始终选择最高奖励臂的智能体所选。在本文中,我们提出了一种用于隐变量老虎机中信息收集的方法。给定特定的奖励结构和转移矩阵,我们表明,根据智能体对状态的信念选择最佳臂会带来更高的后悔值。此外,我们表明通过谨慎选择臂,可改进对状态分布的估计,从而在未来通过更好的臂选择降低累积后悔值。我们在合成和真实世界数据集上评估了我们的方法,显示出相对于最先进方法在后悔值上的显著改进。

关键词

引用

@article{arxiv.2207.03635,
  title  = {Information-Gathering in Latent Bandits},
  author = {Alexander Galozy and Slawomir Nowaczyk},
  journal= {arXiv preprint arXiv:2207.03635},
  year   = {2022}
}