中文

基于自解释引导强化学习从模糊示范中学习

机器学习 2024-02-09 v4

摘要

我们的工作旨在高效利用模糊示范来训练强化学习(RL)智能体。模糊示范通常可有多种解释,这严重阻碍 RL 智能体稳定且高效地学习。由于最优示范也可能存在模糊性,以往结合 RL 与从示范学习(RLfD 工作)的方法可能表现不佳。受人类处理此类情形的启发,我们提出使用自解释(智能体为自身生成解释)来识别有价值的高层关系特征,作为对成功轨迹何以成功的解释。借此,智能体可为其 RL 学习提供一定指导。我们的主要贡献是提出从示范中自解释强化学习(SERLfD)框架,其能克服传统 RLfD 工作的局限。实验结果表明,采用我们的 SERLfD 框架可改善 RLfD 模型在训练稳定性与性能方面的表现。

关键词

引用

@article{arxiv.2110.05286,
  title  = {Learning from Ambiguous Demonstrations with Self-Explanation Guided Reinforcement Learning},
  author = {Yantian Zha and Lin Guan and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2110.05286},
  year   = {2024}
}