中文

用于强化学习中变量选择的序贯 Knockoffs 方法

机器学习 2024-07-31 v2 机器学习

摘要

在强化学习的现实应用中,往往难以在缺乏先验知识的情况下获得既精简又满足马尔可夫性质的状态表示。因此,常见做法是构建大于必要的状态,例如拼接相邻时间点的观测值。然而,不必要地增加状态维度可能减缓学习并模糊所学策略。我们引入马尔可夫决策过程(MDP)中最小充分状态的概念,作为原始状态的子向量,在该子向量下过程仍为 MDP 且与原始过程具有相同奖励函数。我们提出一种新颖的序贯 Knockoffs(SEEK)算法,可在具有高维复杂非线性动力的系统中估计最小充分状态。在大样本下,所提方法达到选择一致性。由于该方法对所采用的强化学习算法无关,其有益于策略学习等下游任务。实证实验验证了理论结果,并表明所提方法在变量选择准确率与后悔值方面优于若干竞争方法。

关键词

引用

@article{arxiv.2303.14281,
  title  = {Sequential Knockoffs for Variable Selection in Reinforcement Learning},
  author = {Tao Ma and Jin Zhu and Hengrui Cai and Zhengling Qi and Yunxiao Chen and Chengchun Shi and Eric B. Laber},
  journal= {arXiv preprint arXiv:2303.14281},
  year   = {2024}
}