基于动作嵌入的学习可迁移策略方法
机器学习
2021-05-11 v3 人工智能
摘要
迁移学习 (TL) 是提高强化学习样本效率的一种有前景的途径。然而,如何高效地跨具有不同状态-动作空间的任务迁移知识尚处于早期研究阶段。以往大多数研究仅通过学习公共特征空间来解决不同状态空间之间的不一致性,而未考虑相关任务的不同动作空间中相似动作具有相似语义这一事实。本文中,我们利用这一思想提出一种学习动作嵌入的方法,以及一种同时学习状态嵌入与动作嵌入以跨不同状态和动作空间迁移策略的框架。我们在多种任务上的实验结果表明,所提方法不仅能学习到信息丰富的动作嵌入,还能加速策略学习。
引用
@article{arxiv.1909.02291,
title = {Learning Action-Transferable Policy with Action Embedding},
author = {Yu Chen and Yingfeng Chen and Zhipeng Hu and Tianpei Yang and Changjie Fan and Yang Yu and Jianye Hao},
journal= {arXiv preprint arXiv:1909.02291},
year = {2021}
}