面向非平稳上下文老虎机的循环神经-线性后验采样
机器学习
2023-11-06 v2 机器学习
摘要
在非平稳上下文老虎机问题中,智能体应在探索与对其先前经验中存在的(周期性或结构化)模式的利用之间进行权衡。手工设计适当的历史上下文是一种有吸引力的替代方案,可将非平稳问题转化为可有效求解的平稳问题。然而,即使是精心设计的历史上下文也可能引入虚假关系或缺乏关键信息的便捷表示。为解决这些问题,我们提出了一种方法,仅基于智能体与环境之间交互的原始历史来学习表示决策的相关上下文。该方法依赖于由循环神经网络提取的特征与基于后验采样的上下文线性老虎机算法的结合。我们在多样化的上下文与非上下文非平稳问题上的实验表明,我们的循环方法始终优于需要手工历史上下文的前馈对应方法,同时比传统非平稳老虎机算法具有更广泛的适用性。尽管很难为我们新方法提供理论性能保证,我们也证明了带测量误差的线性后验采样的一个新的 regret 界,可作为未来理论工作的基础。
引用
@article{arxiv.2007.04750,
title = {Recurrent Neural-Linear Posterior Sampling for Nonstationary Contextual Bandits},
author = {Aditya Ramesh and Paulo Rauber and Michelangelo Conserva and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2007.04750},
year = {2023}
}