ContextWIN:基于深度强化学习的Whittle指数混合专家神经模型用于多臂赌博机问题
机器学习
2024-10-15 v1 信息检索
机器学习
摘要
本研究介绍了ContextWIN,这是一种新颖的架构,它扩展了神经Whittle指数网络(NeurWIN)模型,以解决具有上下文感知方法的无休止多臂赌博机(RMAB)问题。通过在强化学习框架内集成混合专家,ContextWIN巧妙地利用上下文信息来指导动态环境中的决策,特别是在推荐系统中。一个关键创新是模型能够为NeurWIN网络的子集分配特定于上下文的权重,从而提高了每个臂的Whittle指数计算的效率和准确性。本文对ContextWIN进行了全面探索,从其概念基础到实现和潜在应用。我们深入研究了RMAB的复杂性以及融入上下文的重要性,强调了ContextWIN如何有效地利用这些元素。严格证明了NeurWIN和ContextWIN模型的收敛性,确保了理论上的稳健性。这项工作为未来在复杂决策场景中应用上下文信息奠定了基础,并认识到需要全面的数据集探索和环境开发才能充分发挥其潜力。
引用
@article{arxiv.2410.09781,
title = {ContextWIN: Whittle Index Based Mixture-of-Experts Neural Model For Restless Bandits Via Deep RL},
author = {Zhanqiu Guo and Wayne Wang},
journal= {arXiv preprint arXiv:2410.09781},
year = {2024}
}