中文

MENTOR:基于任务导向扰动的混合专家网络用于视觉强化学习

机器人学 2025-07-08 v3 机器学习

摘要

视觉深度强化学习(RL)使机器人能够从视觉输入中获取处理非结构化任务的技能。然而,当前算法存在样本效率低下的问题,限制了其实际应用性。在本工作中,我们提出了 MENTOR,一种改进 RL 代理体系结构和优化的 methods。具体而言,MENTOR 将标准多层感知器(MLP)替换为混合专家(MoE)主干,并引入任务导向扰动机制。MENTOR 在三个模拟基准测试中超越了领先的技术方法,并在三个具有挑战性的真实世界机器人操作任务中实现了 83% 的平均成功率,显著优于最强现有无模型视觉 RL 算法的 32% 成功率。这些结果凸显了在推进视觉 RL 应用于真实世界机器人方面,样本效率的重要性。实验视频可在 https://suninghuang19.github.io/mentor_page/ 查看。

关键词

引用

@article{arxiv.2410.14972,
  title  = {MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning},
  author = {Suning Huang and Zheyu Zhang and Tianhai Liang and Yihan Xu and Zhehao Kou and Chenhao Lu and Guowei Xu and Zhengrong Xue and Huazhe Xu},
  journal= {arXiv preprint arXiv:2410.14972},
  year   = {2025}
}