MENTOR:基于任务导向扰动的混合专家网络用于视觉强化学习
机器人学
2025-07-08 v3 机器学习
摘要
视觉深度强化学习(RL)使机器人能够从视觉输入中获取处理非结构化任务的技能。然而,当前算法存在样本效率低下的问题,限制了其实际应用性。在本工作中,我们提出了 MENTOR,一种改进 RL 代理体系结构和优化的 methods。具体而言,MENTOR 将标准多层感知器(MLP)替换为混合专家(MoE)主干,并引入任务导向扰动机制。MENTOR 在三个模拟基准测试中超越了领先的技术方法,并在三个具有挑战性的真实世界机器人操作任务中实现了 83% 的平均成功率,显著优于最强现有无模型视觉 RL 算法的 32% 成功率。这些结果凸显了在推进视觉 RL 应用于真实世界机器人方面,样本效率的重要性。实验视频可在 https://suninghuang19.github.io/mentor_page/ 查看。
引用
@article{arxiv.2410.14972,
title = {MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning},
author = {Suning Huang and Zheyu Zhang and Tianhai Liang and Yihan Xu and Zhehao Kou and Chenhao Lu and Guowei Xu and Zhengrong Xue and Huazhe Xu},
journal= {arXiv preprint arXiv:2410.14972},
year = {2025}
}