中文

VIRAL:面向人形loco-manipulation的视觉化大规模sim-to-real框架

机器人学 2025-12-01 v2

摘要

人形机器人真实世界部署的关键障碍在于缺乏自主loco-manipulation技能。我们提出VIRAL(Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation),一个在仿真中完全学习人形loco-manipulation并零样部署到真实硬件的视觉化sim-to-real框架。VIRAL采用教师-学生设计:一个基于完整状态的特权RL教师,使用delta动作空间和参考状态初始化学习长期loco-manipulation。随后通过大规模仿真中的平铺渲染,将教师策略蒸馏为基于视觉的学生策略,采用混合的在线DAgger和行为克隆进行训练。我们发现计算规模至关重要:将仿真扩展至最高64个GPU(十几个GPU)后,教师和学生训练都变得可靠,而低计算环境往往会失败。为弥合sim-to-real鸿沟,VIRAL将大规模视觉域随机化(涵盖照明、材料、相机参数、图像质量和传感器延迟)与灵巧手臂和相机的真实到仿真对齐相结合。部署在Unitree G1人形机器人上,最终得到的基于RGB的策略能够在没有任何真实世界微调的情况下,对连续loco-manipulation持续达到54个循环周期,能够泛化到多样的空间和外观变化,接近专家水平的遥控操作性能。对VIRAL的广泛消融实验剖析了使基于RGB的人形loco-manipulation在实际中可行的关键设计选择。

关键词

引用

@article{arxiv.2511.15200,
  title  = {VIRAL: Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation},
  author = {Tairan He and Zi Wang and Haoru Xue and Qingwei Ben and Zhengyi Luo and Wenli Xiao and Ye Yuan and Xingye Da and Fernando Castañeda and Shankar Sastry and Changliu Liu and Guanya Shi and Linxi Fan and Yuke Zhu},
  journal= {arXiv preprint arXiv:2511.15200},
  year   = {2025}
}

备注

Project website: https://viral-humanoid.github.io/