中文

逆强化学习是否比标准强化学习更难?一种理论视角

机器学习 2024-02-13 v2 人工智能 机器学习

摘要

逆强化学习(IRL)——从\emph{专家策略}的演示中学习奖励函数的问题——在开发智能系统中起着关键作用。尽管在应用中被广泛使用,与标准 RL 相比,IRL 的理论理解面临独特挑战且发展较不充分。例如,如何在具有预收集数据的标准\emph{离线}设置中高效地进行 IRL 仍属开放问题,其中状态来自\emph{行为策略}(其本身可以是专家策略),而动作从专家策略中采样。本文给出了在普通离线与在线设置中使用多项式样本与运行时间实现高效 IRL 的首批结果。我们的算法与分析无缝适配离线 RL 中常用的悲观原则,并在比现有工作所考虑更强的度量下达成 IRL 保证。我们提供了下界,表明我们的样本复杂度近乎最优。作为一个应用,我们还展示了当目标 MDP 与原始(源)MDP 满足某些相似性假设时,所学得的奖励能够以合适保证\emph{迁移}至另一目标 MDP。

关键词

引用

@article{arxiv.2312.00054,
  title  = {Is Inverse Reinforcement Learning Harder than Standard Reinforcement Learning? A Theoretical Perspective},
  author = {Lei Zhao and Mengdi Wang and Yu Bai},
  journal= {arXiv preprint arXiv:2312.00054},
  year   = {2024}
}