中文

论策略复用中短视行为的价值

机器学习 2023-05-30 v1

摘要

在陌生场景中利用已学策略是人类智能的基础。在强化学习中,理性地复用从其他任务或人类专家处获得的策略,对于解决难以从零开始学习的问题至关重要。在本工作中,我们提出了一个称为选择性短视行为控制(SMEC)的框架,其源于先前策略的短期行为可跨任务共享这一洞见。通过混合值函数架构评估先前策略的行为,SMEC 自适应地聚合先前策略可共享的短期行为与任务策略的长期行为,从而做出协调决策。在一系列操控与运动任务上的实证结果表明,SMEC 优于现有方法,并验证了 SMEC 利用相关先前策略的能力。

关键词

引用

@article{arxiv.2305.17623,
  title  = {On the Value of Myopic Behavior in Policy Reuse},
  author = {Kang Xu and Chenjia Bai and Shuang Qiu and Haoran He and Bin Zhao and Zhen Wang and Wei Li and Xuelong Li},
  journal= {arXiv preprint arXiv:2305.17623},
  year   = {2023}
}

备注

28 pages, 25 figures