对抗性损失与转移下的无后悔在线强化学习
机器学习
2023-10-27 v3 机器学习
摘要
现有的对抗性马尔可夫决策过程在线学习算法在T轮交互后实现后悔值,即使损失函数由对手任意选定,前提是转移函数必须固定。这是因为已有研究表明对抗性转移函数使无后悔学习不可能。尽管存在此类不可能性结果,本文中我们开发了能够处理对抗性损失与对抗性转移的算法,其后悔值随对手恶意程度平滑增长。更具体地,我们首先提出一种算法,其享有后悔值,其中度量转移函数的对抗程度,且至多为。尽管该算法本身需要已知,我们进一步开发了黑盒归约方法以消除此要求。此外,我们还表明算法的进一步改进不仅维持相同的后悔界,同时自适应于更易的环境(其中损失以Jin等人[2021]所述的某种随机约束方式生成)并实现后悔值,其中为某标准间隙依赖系数,为损失上的腐败量。
引用
@article{arxiv.2305.17380,
title = {No-Regret Online Reinforcement Learning with Adversarial Losses and Transitions},
author = {Tiancheng Jin and Junyan Liu and Chloé Rouyer and William Chang and Chen-Yu Wei and Haipeng Luo},
journal= {arXiv preprint arXiv:2305.17380},
year = {2023}
}
备注
Update the camera-ready version for NeurIPS 2023