中文

Squint:用于 Sim-to-Real 机器人视觉强化学习的快速方法

机器人学 2026-02-25 v1 计算机视觉与模式识别 机器学习

摘要

视觉强化学习对机器人很有吸引力,但成本高昂——离策略方法在样本效率上优于在策略方法,但计算速度慢;在策略方法能有效并行,但浪费样本。最近的研究表明,离策略方法在基于状态的控制中可比在策略方法更快地完成墙钟时间训练。将其扩展到视觉仍具有挑战性,由于高维输入图像复杂化了训练动力学,并引入了大量的存储和编码开销。为解决这些挑战,我们引入了 Squint,这是一种视觉 Soft Actor Critic 方法,能够在墙钟时间上快于先前的视觉离策略和在策略方法。Squint 通过并行仿真、分布式 critic、分辨率 squint、层归一化、调整的更新到数据比率以及优化实现实现了这一目标。我们在 ManiSkill3 中的 SO-101 任务集合上进行评估,这是一个包含八个操纵任务的新套件,采用大量域随机化,并演示了到真实 SO-101 机器人的 Sim-to-Real 迁移。我们在单张 RTX 3090 GPU 上训练策略 15 分钟,大多数任务在 6 分钟内即可收敛。

关键词

引用

@article{arxiv.2602.21203,
  title  = {Squint: Fast Visual Reinforcement Learning for Sim-to-Real Robotics},
  author = {Abdulaziz Almuzairee and Henrik I. Christensen},
  journal= {arXiv preprint arXiv:2602.21203},
  year   = {2026}
}

备注

For website and code, see https://aalmuzairee.github.io/squint