中文

一种无模型熵正则化逆强化学习算法的收敛性

机器学习 2025-03-04 v3 人工智能

摘要

给定一个专家演示数据集,逆强化学习(IRL)旨在恢复一个使得专家最优的奖励。这项工作提出了一种无模型算法来解决熵正则化 IRL 问题。具体而言,我们对奖励采用随机梯度下降更新,对策略采用随机软策略迭代更新。在假设可以访问生成模型的情况下,我们证明我们的算法保证能够使用 O(1/ε2)\mathcal{O}(1/\varepsilon^{2}) 个马尔可夫决策过程(MDP) 样本,恢复一个使得专家达到 ε\varepsilon-最优的奖励。此外,利用 O(1/ε4)\mathcal{O}(1/\varepsilon^{4}) 个样本,我们证明与恢复的奖励相对应的最优策略在总变差距离上与专家策略 ε\varepsilon-接近。

关键词

引用

@article{arxiv.2403.16829,
  title  = {Convergence of a model-free entropy-regularized inverse reinforcement learning algorithm},
  author = {Titouan Renard and Andreas Schlaginhaufen and Tingting Ni and Maryam Kamgarpour},
  journal= {arXiv preprint arXiv:2403.16829},
  year   = {2025}
}