面向带 bandit 反馈的对抗马尔可夫决策过程的 Follow-the-Perturbed-Leader 方法
机器学习
2022-09-20 v2 人工智能
机器学习
摘要
我们考虑对抗马尔可夫决策过程(AMDPs)中的后悔最小化,其中损失函数随时间变化且由对手选择,学习者仅观测到所访问状态-动作对的损失(即 bandit 反馈)。尽管使用在线镜像下降(OMD)方法研究该问题的文献激增,人们对 Follow-the-Perturbed-Leader (FTPL) 方法却知之甚少,而后者通常计算更高效且更易实现,因为它只需求解一个离线规划问题。受此驱动,我们重新审视用于学习 AMDPs 的 FTPL,从标准片段式有限时域设定入手。我们发现分析中一些独特且有趣的困难,并提出一种变通方案,最终表明 FTPL 在此情形下也能达到近最优后悔界。更重要的是,我们进而发现两个重要应用:第一,FTPL 的分析可轻易推广到具有序最优后悔的延迟 bandit 反馈,而 OMD 方法表现出额外困难(Jin et al., 2022)。第二,利用 FTPL,我们开发了首个在无限时域设定下、带 bandit 反馈与随机转移的学习可通信 AMDPs 的无后悔算法。我们的算法在假设可访问离线规划预言机时是高效的,而即便在更易的全信息设定下,唯一现有算法(Chandrasekaran and Tewari, 2021)计算上也是低效的。
引用
@article{arxiv.2205.13451,
title = {Follow-the-Perturbed-Leader for Adversarial Markov Decision Processes with Bandit Feedback},
author = {Yan Dai and Haipeng Luo and Liyu Chen},
journal= {arXiv preprint arXiv:2205.13451},
year = {2022}
}
备注
Accepted to NeurIPS 2022