State2vec:离策略后继特征近似器
机器学习
2019-10-24 v1 机器学习
摘要
强化学习(RL)中的一个主要挑战是设计能够在共享相同动态的任务间进行泛化的智能体。一个可行的解决方案是元强化学习,其识别过往任务间的共同结构,进而泛化到新任务(元测试)。在元训练阶段,RL 智能体学习状态表示,以编码来自一组任务的先验信息,用于泛化值函数近似。文献中已提出作为后继表示近似器。尽管有前景,这些方法在不同最优策略间的泛化能力不佳,导致元测试阶段采样效率低下。本文中,我们提出 state2vec,一种高效且低复杂度的后继特征学习框架,其(i)跨策略泛化,(ii)确保元测试阶段的样本效率。我们扩展著名的 node2vec 框架以学习状态嵌入,该嵌入考虑了 RL 中折扣未来状态转移。所提出的离策略 state2vec 捕捉底层状态空间的几何结构,为线性值函数近似提供良好的基函数。
引用
@article{arxiv.1910.10277,
title = {State2vec: Off-Policy Successor Features Approximators},
author = {Sephora Madjiheurem and Laura Toni},
journal= {arXiv preprint arXiv:1910.10277},
year = {2019}
}