基于线性高斯动态系统生成奖励的无止境多臂赌博问题
机器学习
2024-05-24 v2 机器学习
系统与控制
系统与控制
摘要
在不确定性下进行决策是频繁遇到的基本问题,可形式化为随机多臂赌博问题。在该问题中,学习者在每个轮次中通过选择动作与环境交互,轮次即为一次交互实例。环境随后返回抽样于随机过程的奖励,以供学习者使用。学习者的目标是最大化累计奖励。本文假设奖励为动作向量与由线性高斯动态系统生成的状态向量的内积。为预测每个动作的奖励,我们提出一种方法,通过对先前观察到的奖励的线性组合来预测每个动作的下一个奖励。我们证明,无论之前选择的动作序列如何,针对任何先前所选动作抽样得到的奖励,都可用于预测另一个动作的未来奖励,即在轮次t-1选择动作1所抽样的奖励,可用于预测轮次t中动作2的奖励。这通过设计一种可学习奖励预测的矩阵表示形式的改进卡尔曼滤波器来实现。我们在一组线性高斯动态系统上进行数值评估,并与两种著名的随机多臂赌博算法进行比较。
引用
@article{arxiv.2405.09584,
title = {Restless Bandit Problem with Rewards Generated by a Linear Gaussian Dynamical System},
author = {Jonathan Gornet and Bruno Sinopoli},
journal= {arXiv preprint arXiv:2405.09584},
year = {2024}
}