论策略复用中短视行为的价值
机器学习
2023-05-30 v1
摘要
在陌生场景中利用已学策略是人类智能的基础。在强化学习中,理性地复用从其他任务或人类专家处获得的策略,对于解决难以从零开始学习的问题至关重要。在本工作中,我们提出了一个称为选择性短视行为控制(SMEC)的框架,其源于先前策略的短期行为可跨任务共享这一洞见。通过混合值函数架构评估先前策略的行为,SMEC 自适应地聚合先前策略可共享的短期行为与任务策略的长期行为,从而做出协调决策。在一系列操控与运动任务上的实证结果表明,SMEC 优于现有方法,并验证了 SMEC 利用相关先前策略的能力。
引用
@article{arxiv.2305.17623,
title = {On the Value of Myopic Behavior in Policy Reuse},
author = {Kang Xu and Chenjia Bai and Shuang Qiu and Haoran He and Bin Zhao and Zhen Wang and Wei Li and Xuelong Li},
journal= {arXiv preprint arXiv:2305.17623},
year = {2023}
}
备注
28 pages, 25 figures