中文

使用归一化权重函数改进多臂赌博机的奖励条件策略

机器学习 2024-06-18 v1 机器学习

摘要

最近提出的奖励条件策略(RCP)为强化学习提供了一种有吸引力的替代方案。与策略梯度方法相比,RCP中的策略学习更简单,因为它基于监督学习,并且与基于值的方法不同,它不需要在动作空间中进行优化来采取行动。然而,对于多臂赌博机(MAB)问题,我们发现与经典方法(如置信上界和汤普森采样)相比,RCP收敛速度较慢,且收敛时的期望奖励较差。在这项工作中,我们表明,通过使用归一化权重函数(其和或积分等于1,尽管函数值可能为负)对奖励进行边缘化来构建策略,可以增强RCP的性能。我们将此技术称为广义边缘化,其优势在于,对于以低奖励为条件的策略,负权重可以使所得策略与这些策略更具区分度。研究了在具有离散动作空间的MAB中执行广义边缘化的策略。通过模拟,我们证明了所提出的技术改进了RCP,使其与经典方法具有竞争力,在具有大动作空间和稀疏奖励信号的具有挑战性的MAB上表现出优越的性能。

关键词

引用

@article{arxiv.2406.10795,
  title  = {Improving Reward-Conditioned Policies for Multi-Armed Bandits using Normalized Weight Functions},
  author = {Kai Xu and Farid Tajaddodianfar and Ben Allison},
  journal= {arXiv preprint arXiv:2406.10795},
  year   = {2024}
}