中文

超越黑盒建议:带 Q 值预测 MDP 的学习增强算法

机器学习 2023-10-31 v2 性能

摘要

我们研究了在具有不可信机器学习建议的单轨迹时变马尔可夫决策过程(MDP)中一致性与鲁棒性之间的权衡。我们的工作偏离了将建议视为来自黑盒来源的典型做法,转而考虑一种可获得关于建议如何生成的额外信息的设定。我们证明了在包含连续与离散状态/动作空间的一般 MDP 模型下,给定 Q 值建议的首创一致性与鲁棒性权衡。我们的结果强调,利用 Q 值建议能够动态追求机器学习建议与鲁棒基线中较优者,从而获得近最优的性能保证,这可证明地改进了仅使用黑盒建议所能取得的结果。

关键词

引用

@article{arxiv.2307.10524,
  title  = {Beyond Black-Box Advice: Learning-Augmented Algorithms for MDPs with Q-Value Predictions},
  author = {Tongxin Li and Yiheng Lin and Shaolei Ren and Adam Wierman},
  journal= {arXiv preprint arXiv:2307.10524},
  year   = {2023}
}

备注

32 pages, NeurIPS 2023