中文

后继特征神经情景控制

机器学习 2023-08-04 v2 人工智能

摘要

强化学习的一个长期目标是构建出表现出快速学习与类似人类和动物的灵活技能迁移的智能体。本文研究了为实现这些目标而提出的两种框架的整合:情景控制和后继特征。情景控制是一种受认知启发的方法,依赖于情景记忆,即智能体经验的基于实例的记忆模型。同时,后继特征与广义策略改进(SF&GPI)是一种元学习与迁移学习框架,允许学习可用于高效重用于后续具有不同奖励函数的任务的策略。这两种技术各自在大幅提高样本效率和优雅重用先前学习策略方面展现了出色的结果。因此,我们在单一的强化学习框架中概述了这两种方法的结合,并实证说明了其优势。

关键词

引用

@article{arxiv.2111.03110,
  title  = {Successor Feature Neural Episodic Control},
  author = {David Emukpere and Xavier Alameda-Pineda and Chris Reinke},
  journal= {arXiv preprint arXiv:2111.03110},
  year   = {2023}
}