中文

基于规约的强化学习中的归纳泛化

机器学习 2024-06-07 v1 人工智能 计算机科学中的逻辑

摘要

我们提出了一种新颖的、用于从逻辑规约进行强化学习的归纳泛化框架。强化学习环境中的许多有趣任务都具有自然的归纳结构。这些归纳任务具有相似的总体目标,但在低级谓词和分布上存在归纳差异。我们提出了一种泛化过程,该过程利用这种归纳关系来学习一个高阶函数,即策略生成器,该生成器以零样本方式为归纳任务的实例生成适当调整的策略。在一组具有挑战性的控制基准测试上对所提出方法的评估,证明了我们的框架在泛化到长时域任务的未见策略方面的潜力。

关键词

引用

@article{arxiv.2406.03651,
  title  = {Inductive Generalization in Reinforcement Learning from Specifications},
  author = {Vignesh Subramanian and Rohit Kushwah and Subhajit Roy and Suguman Bansal},
  journal= {arXiv preprint arXiv:2406.03651},
  year   = {2024}
}