DeepTOP:面向 MDP 与 RMAB 的深度阈值最优策略
机器学习
2022-09-30 v2 人工智能
摘要
我们考虑为控制问题学习最优阈值策略的问题。阈值策略通过判断系统状态的某个元素是否超过某一阈值来做出控制决策,该阈值由系统状态的其他元素决定。利用阈值策略的单调性,我们证明其策略梯度具有出人意料地简单的表达式。我们利用该简单表达式构建了一种离屏 actor-critic 算法以学习最优阈值策略。仿真结果表明,由于能利用单调性,我们的策略显著优于其他强化学习算法。此外,我们证明用于 restless 多臂老虎机问题的有力工具 Whittle 索引,等价于一个替代问题的最优阈值策略。该观察导出了一种简单算法,通过在替代问题中学习最优阈值策略来求取 Whittle 索引。仿真结果表明,我们的算法比若干近期通过间接手段学习 Whittle 索引的研究学习得快得多。
引用
@article{arxiv.2209.08646,
title = {DeepTOP: Deep Threshold-Optimal Policy for MDPs and RMABs},
author = {Khaled Nakhleh and I-Hong Hou},
journal= {arXiv preprint arXiv:2209.08646},
year = {2022}
}
备注
Accepted for publication in NeurIPS 2022