中文

非平稳 MDP 的预测控制与前视信息 regret 分析

机器学习 2025-11-17 v2

摘要

在非平稳马尔可夫决策过程(MDP)中进行策略设计本构成挑战,因为其时间可变的转移与奖励使得学习者难以确定以最大化累积未来奖励为目标的最优动作。幸运的是,在许多实际应用中(如能源系统),可获得前视预测,包括可再生能源发电和需求预测。在本文中,我们利用这些前视预测提出一种算法,以实现非平稳 MDP 中的低 regret。我们的理论分析表明,在某些假设下,随着前视窗口的扩大,regret 以指数级下降。当系统预测受误差影响时,尽管预测误差随预测时域范围而指数级增长,regret 仍不会爆炸。我们通过仿真验证了该方法在非平稳环境中的有效性。

关键词

引用

@article{arxiv.2409.08434,
  title  = {Predictive Control and Regret Analysis of Non-Stationary MDP with Look-ahead Information},
  author = {Ziyi Zhang and Yorie Nakahira and Guannan Qu},
  journal= {arXiv preprint arXiv:2409.08434},
  year   = {2025}
}

备注

TMLR, 2025