基于被动朗之万动力学的自适应逆强化学习的有限样本界
机器学习
2025-01-16 v3 机器学习
摘要
本文提供了对被动随机梯度朗之万动力学(PSGLD)算法的有限样本分析。该算法旨在实现自适应逆强化学习(IRL)。自适应IRL旨在通过实时观测前向学习器执行随机梯度算法(例如策略梯度强化学习)的估计,来估计该前向学习器的代价函数。PSGLD算法被认为是被动的,因为它整合了由外部随机梯度算法(前向学习器)提供的带噪梯度,而对其并无控制。PSGLD算法充当随机采样器,通过从朗之万扩散的平稳测度非参数地重构前向学习器的代价函数,来实现自适应IRL。本文分析了其非渐近(有限样本)性能;我们给出了PSGLD算法样本测度与编码代价函数的平稳测度之间2-Wasserstein距离的显式界,并为从经验样本重构代价函数的核密度估计方案提供了保证。我们的分析使用了马尔可夫扩散算子研究的工具。所推导的界具有实际与理论双重意义。它们为自适应IRL机制提供了有限时间保证,并大幅推广了被动随机梯度算法一系列研究中的分析框架。
引用
@article{arxiv.2304.09123,
title = {Finite-Sample Bounds for Adaptive Inverse Reinforcement Learning using Passive Langevin Dynamics},
author = {Luke Snow and Vikram Krishnamurthy},
journal= {arXiv preprint arXiv:2304.09123},
year = {2025}
}