中文

对抗性损失与转移下的无后悔在线强化学习

机器学习 2023-10-27 v3 机器学习

摘要

现有的对抗性马尔可夫决策过程在线学习算法在T轮交互后实现O(T){O}(\sqrt{T})后悔值,即使损失函数由对手任意选定,前提是转移函数必须固定。这是因为已有研究表明对抗性转移函数使无后悔学习不可能。尽管存在此类不可能性结果,本文中我们开发了能够处理对抗性损失与对抗性转移的算法,其后悔值随对手恶意程度平滑增长。更具体地,我们首先提出一种算法,其享有O~(T+CP)\widetilde{{O}}(\sqrt{T} + C^{\textsf{P}})后悔值,其中CPC^{\textsf{P}}度量转移函数的对抗程度,且至多为O(T){O}(T)。尽管该算法本身需要已知CPC^{\textsf{P}},我们进一步开发了黑盒归约方法以消除此要求。此外,我们还表明算法的进一步改进不仅维持相同的后悔界,同时自适应于更易的环境(其中损失以Jin等人[2021]所述的某种随机约束方式生成)并实现O~(U+UCL+CP)\widetilde{{O}}(U + \sqrt{UC^{\textsf{L}}} + C^{\textsf{P}})后悔值,其中UU为某标准间隙依赖系数,CLC^{\textsf{L}}为损失上的腐败量。

关键词

引用

@article{arxiv.2305.17380,
  title  = {No-Regret Online Reinforcement Learning with Adversarial Losses and Transitions},
  author = {Tiancheng Jin and Junyan Liu and Chloé Rouyer and William Chang and Chen-Yu Wei and Haipeng Luo},
  journal= {arXiv preprint arXiv:2305.17380},
  year   = {2023}
}

备注

Update the camera-ready version for NeurIPS 2023