合并决策变换器:通过权重平均形成多任务策略
机器学习
2023-09-26 v3 人工智能
摘要
近期研究表明,构建用于语言、视觉与序列决策问题的基于 transformer 的通用模型具有前景。为创建此类模型,通常需要集中式的训练目标、数据与计算资源。若能通过将多个特定任务、各自训练的策略合并来更灵活地创建通用策略,则颇具意义。本文中,我们朝此方向迈出初步一步:在参数空间中对在不同 MuJoCo 运动问题上训练的 Decision Transformer 子集进行合并或平均,从而在无需集中训练的情况下形成多任务模型。我们还展示了合并策略时若干方法选择的重要性,例如利用共同的预训练初始化、增大模型容量,以及利用 Fisher 信息加权参数重要性。总体而言,我们认为该方向的研究有助于使多任务机器人策略的形成过程民主化与分布式。我们的实现见 https://github.com/daniellawson9999/merging-decision-transformers。
引用
@article{arxiv.2303.07551,
title = {Merging Decision Transformers: Weight Averaging for Forming Multi-Task Policies},
author = {Daniel Lawson and Ahmed H. Qureshi},
journal= {arXiv preprint arXiv:2303.07551},
year = {2023}
}