Tra-MoE:从多个领域学习轨迹预测模型以实现自适应策略条件
机器人学
2025-04-02 v2
摘要
从多个领域学习是单一统一机器人系统泛化能力的主要影响因素。本文旨在利用广泛的域外数据来提高轨迹预测模型的性能和泛化能力。设计了轨迹模型,用于预测给定指令的当前帧中任意点的轨迹,并为机器人策略学习提供详细的控制指导。为了处理多样化的域外数据分布,我们提出了稀疏门控混合专家(MoE,采用Top-1门控策略)架构,用于轨迹模型,称为Tra-MoE。稀疏激活设计实现了参数协作与专业化之间的良好平衡,有效地从大规模域外数据中受益,同时保持每个token的常数FLOPs。此外,我们进一步引入了通过学习预测轨迹的2D掩码表示来实现自适应策略条件的技术,这些表示与图像观察显式对齐,以更灵活地指导动作预测。我们在仿真和真实世界场景中进行了广泛实验,以验证Tra-MoE和自适应策略条件技术的有效性。我们还进行了全面的经验研究,以训练Tra-MoE,表明我们的Tra-MoE在参数数量匹配Tra-MoE的情况下,始终优于稠密基线模型。
引用
@article{arxiv.2411.14519,
title = {Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy Conditioning},
author = {Jiange Yang and Haoyi Zhu and Yating Wang and Gangshan Wu and Tong He and Limin Wang},
journal= {arXiv preprint arXiv:2411.14519},
year = {2025}
}
备注
Accepted to CVPR 2025. Code Page: https://github.com/MCG-NJU/Tra-MoE