关于上下翻转强化学习、目标条件监督学习和在线决策变换器的收敛与稳定性
机器学习
2025-11-12 v2 人工智能
机器学习
神经与进化计算
系统与控制
系统与控制
摘要
本文对Episodic Upside-Down强化学习、目标条件监督学习和Online Decision Transformers的收敛性和稳定性进行严格分析。这些算法在从游戏到机器人任务的各种基准上表现出竞争力,但其理论理解仅限于特定环境条件。本工作为基于通过监督学习或序列建模方法来 approaches 强化学习的算法提供了理论基础。本次调查的核心在于分析环境的条件,以确定算法是否能够识别最优解。我们还评估了新近求解方案在环境受到微小噪声影响的情况下是否保持稳定。具体而言,我们研究了以特定拓扑为基准,命令条件策略、价值和目标到达目标函数在底层马尔可夫决策过程转换核上的连续性和渐近收敛性。我们表明,如果转换核位于足够小的确定性核邻域中,则可实现接近最优的行为。上述量在确定性核上是连续的(无论是渐近地还是经过有限的学习周期后),既是连续的。所发展的方法允许我们首次明确地以底层转换核为基准,呈现策略和价值在收敛和稳定性方面的估计。在理论侧,我们引入了许多新的强化学习概念,如在段空间中工作、研究商拓扑中的连续性以及动力系统固定点理论的应用。该理论研究伴随着对示例环境和数值实验的详细调查。
引用
@article{arxiv.2502.05672,
title = {On the Convergence and Stability of Upside-Down Reinforcement Learning, Goal-Conditioned Supervised Learning, and Online Decision Transformers},
author = {Miroslav Štrupl and Oleg Szehr and Francesco Faccio and Dylan R. Ashley and Rupesh Kumar Srivastava and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2502.05672},
year = {2025}
}
备注
85 pages in main text + 4 pages of references + 26 pages of appendices, 12 figures in main text + 2 figures in appendices; source code available at https://github.com/struplm/eUDRL-GCSL-ODT-Convergence-public