基于在线高置信变点检测的非平稳强化学习最小延迟自适应
机器学习
2021-05-21 v1 人工智能
摘要
非平稳环境对强化学习算法而言充满挑战。若状态转移和/或奖励函数基于潜在因素发生变化,智能体实际上被赋予一项优化任务:在可能无限的马尔可夫决策过程(MDP)随机序列上最大化性能,其中每个 MDP 均从某个未知分布中抽取。我们将每个这样的 MDP 称为一个上下文。大多数相关工作做出了强假设,例如已知上下文上的分布、存在预训练阶段,或事先已知上下文的数量、序列或边界。我们提出了一种在非平稳环境中高效学习策略的算法。它分析可能无限的数据流,并实时计算高置信变点检测统计量,以反映是否需要创建并部署新的专用策略来应对新上下文,或是否可以复用先前优化的策略。我们证明:(i) 该算法最小化了检测到上下文未预见变化前的延迟,从而实现快速响应;(ii) 它限制了误报率,这对于最小化后悔值至关重要。我们的方法构建了一个由(可能无限的)概率动力学预测器集成组成的混合模型,用于对潜在潜在 MDP 分布的不同模态进行建模。我们在高维连续强化学习问题上评估了我们的算法,结果表明其优于最先进的(无模型与基于模型的)RL 算法,以及专门设计用于处理非平稳性的最先进元学习方法。
引用
@article{arxiv.2105.09452,
title = {Minimum-Delay Adaptation in Non-Stationary Reinforcement Learning via Online High-Confidence Change-Point Detection},
author = {Lucas N. Alegre and Ana L. C. Bazzan and Bruno C. da Silva},
journal= {arXiv preprint arXiv:2105.09452},
year = {2021}
}
备注
Published at Proc. of the 20th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2021)