利用时延长行为共享实现多任务强化学习
机器人学
2025-09-30 v2 机器学习
摘要
多任务强化学习 (MTRL) 通过在多个任务上训练智能体,实现知识共享,为提高样本效率和泛化性提供了可行方案。然而,由于收集多样化任务数据的高成本, 将 MTRL 应用于机器人领域仍面临挑战。为此,我们提出了 MT-L\'evy,一种新颖的探索策略,通过结合跨任务行为共享与受 L\'evy flight 启发的时延长探索,增强 MTRL 环境中的样本效率。MT-L\'evy 利用在相关任务上训练的策略引导探索向关键状态移动,同时根据任务成功率动态调整探索水平。该方法即使在复杂的机器人环境中,也能实现更有效的状态空间覆盖。经验结果表明,MT-L\'evy 在探索和样本效率方面显著提升,得到定量和定性分析的支持。消融研究进一步突出了每个组件的贡献,表明结合行为共享与自适应探索策略可显著提升机器人应用中 MTRL 的实用性。
引用
@article{arxiv.2509.20766,
title = {Leveraging Temporally Extended Behavior Sharing for Multi-task Reinforcement Learning},
author = {Gawon Lee and Daesol Cho and H. Jin Kim},
journal= {arXiv preprint arXiv:2509.20766},
year = {2025}
}
备注
Accepted for publication in the proceedings of the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)