基于分布值近似的Switch轨迹变换器用于多任务强化学习
机器学习
2022-03-16 v1 人工智能
摘要
我们提出SwitchTT,一种Trajectory Transformer的多任务扩展,并增强两个显著特性:(i)利用稀疏激活模型降低多任务离线模型学习中的计算开销;(ii)采用分布轨迹值估计器提升策略性能,尤其在稀疏奖励设定下。这两处改进使SwitchTT适用于求解多任务离线强化学习问题,其中模型容量对吸收多任务数据集中海量知识至关重要。更具体地,SwitchTT利用switch transformer模型架构进行多任务策略学习,使我们能提升模型容量而不按比例增加计算成本。同时,SwitchTT近似轨迹值的分布而非期望,缓解了蒙特卡洛值估计器样本复杂度差的影响,尤其在稀疏奖励设定下。我们使用来自gym-mini-grid环境的十个稀疏奖励任务套件评估方法。我们在10任务学习上较Trajectory Transformer提升10%,并获得最高90%的离线模型训练加速。我们的结果也展示了switch transformer模型吸收专家知识的优势,以及值分布在轨迹评估中的重要性。
引用
@article{arxiv.2203.07413,
title = {Switch Trajectory Transformer with Distributional Value Approximation for Multi-Task Reinforcement Learning},
author = {Qinjie Lin and Han Liu and Biswa Sengupta},
journal= {arXiv preprint arXiv:2203.07413},
year = {2022}
}