中文

基于奖励机抽象的任务上下文预规划以增强深度强化学习中的迁移

人工智能 2024-02-22 v4 机器学习

摘要

近期研究表明,深度强化学习(DRL)智能体倾向于过拟合于其受训任务,且无法适应微小的环境变化。为在迁移至未见任务时加速学习,我们提出一种新方法,利用奖励机(RMs)——基于当前任务的奖励与动力学诱导子任务的状态机抽象——来表示当前任务。我们的方法为智能体提供从其当前抽象状态出发的最优转移的符号表示,并因达成这些转移而给予奖励。这些表示跨任务共享,使智能体能利用先前遇到的符号与转移知识,从而增强迁移。实证结果显示,我们的表示在多种领域中提升了样本效率与少样本迁移能力。

关键词

引用

@article{arxiv.2307.05209,
  title  = {Contextual Pre-planning on Reward Machine Abstractions for Enhanced Transfer in Deep Reinforcement Learning},
  author = {Guy Azran and Mohamad H. Danesh and Stefano V. Albrecht and Sarah Keren},
  journal= {arXiv preprint arXiv:2307.05209},
  year   = {2024}
}

备注

Proceedings of the 38th AAAI Conference on Artificial Intelligence (AAAI), 2024