面向带有bandit反馈的CMDP的最佳两手策略优化
机器学习
2025-02-10 v2
摘要
我们研究受约束马尔可夫决策过程(CMDP)中的在线学习,其中奖励和约束可能是随机的或对抗性的。在此类设置下,Stradi等人(2024)提出了第一个能够无缝处理随机约束和对抗性约束的双世界最佳算法,同时在两种情况下实现最优 regret和约束违反界限。该算法存在两个主要缺陷:首先,它仅适用于完全反馈,这严重限制了其在实际中的应用。其次,它依赖于优化占用措施的空间,这需要求解凸优化问题,效率极低。在本文中,我们提供了面向带有bandit反馈的CMDP的第一个双世界最佳算法。具体而言,当约束为随机时,算法实现 的regret和约束违反;当约束为对抗性时,它实现 的约束违反和紧密的optimal reward比例。此外,我们的算法基于策略优化方法,这比占用措施方法更高效。
引用
@article{arxiv.2410.02269,
title = {Best-of-Both-Worlds Policy Optimization for CMDPs with Bandit Feedback},
author = {Francesco Emanuele Stradi and Anna Lunghi and Matteo Castiglioni and Alberto Marchesi and Nicola Gatti},
journal= {arXiv preprint arXiv:2410.02269},
year = {2025}
}