线性CMDP的原始-对偶策略优化:面向对抗性损失
机器学习
2026-05-13 v1
摘要
现有关于线性约束马尔可夫决策过程(CMDP)的工作主要聚焦于随机环境,其中损失和成本要么是固定的,要么来自固定分布。然而,这类表述本质上对抗性变化的环境极其脆弱。为克服这一限制,我们提出一种针对online有限时段对抗性线性CMDP的原始-对偶策略优化算法,其中损失在完全信息反馈下被 adversaries 选择,而成本在bandit反馈下为随机。我们的算法是在该设置下实现亚线性 regret和约束违反界限的首个算法,两者均由界限给出,其中为episode数量。算法引入并运行一种新型策略,称为加权LogSumExp softmax策略,旨在适应adversaries选择的损失函数。我们的主要结果源于以下关键贡献:(i)对加权LogSumExp策略的新型覆盖数论证,(ii)两种新算法组件——定期策略混合和正则化对偶更新——允许我们有效控制覆盖数和对偶变量。我们还报告了数值结果,验证了算法性能的理论发现。
引用
@article{arxiv.2605.11535,
title = {Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses},
author = {Kihyun Yu and Seoungbin Bae and Dabeen Lee},
journal= {arXiv preprint arXiv:2605.11535},
year = {2026}
}
备注
Accepted to ICLR 2026