中文

通过任务特定动作校正的高效多任务强化学习

机器学习 2024-04-10 v1 人工智能 机器人学

摘要

多任务强化学习(MTRL)在增强机器人泛化能力、使其能够同时执行多个任务方面展现出潜力。然而,MTRL的性能可能仍会受到任务间冲突和负干扰的影响。为了促进高效的MTRL,我们提出了任务特定动作校正(TSAC),这是一种通用的互补方法,用于同时学习多个任务。TSAC将策略学习分解为两个独立的策略:共享策略(SP)和动作校正策略(ACP)。为了缓解SP中过度关注特定任务细节而导致的冲突,ACP引入了目标导向的稀疏奖励,使智能体能够采取长期视角并实现跨任务的泛化。额外的奖励将原始问题转化为多目标MTRL问题。此外,为了将多目标MTRL转化为单目标形式,TSAC为稀疏奖励分配了一个虚拟期望预算,并采用拉格朗日方法将约束单目标优化转化为无约束优化。在Meta-World的MT10和MT50基准上的实验评估表明,TSAC优于现有最先进方法,在样本效率和有效动作执行方面均取得了显著改进。

关键词

引用

@article{arxiv.2404.05950,
  title  = {Efficient Multi-Task Reinforcement Learning via Task-Specific Action Correction},
  author = {Jinyuan Feng and Min Chen and Zhiqiang Pu and Tenghai Qiu and Jianqiang Yi},
  journal= {arXiv preprint arXiv:2404.05950},
  year   = {2024}
}