中文

RoboPocket:使用您的手机即时改进机器人策略

机器人学 2026-03-09 v2 人工智能 机器学习

摘要

模仿学习的规模化在数据收集效率方面受到根本性限制。虽然手持式界面作为面向野外数据获取的可扩展解决方案而涌现,但主要以非互动方式运行:操作员在不了解 underlying policy弱点的前提下盲目收集演示,导致对关键状态分布的覆盖不足。相反,诸如DAgger等互动方法有效解决协变量漂移问题,但依赖物理机器人执行,成本高昂且难以规模化。为调和这一权衡,我们引入RoboPocket,这是一个可携式系统,使能够使用单个消费级智能手机实现无机器人即时策略迭代。其核心创新是Remote Inference框架,通过增强现实(AR)视觉预知可视化policy预测的轨迹。这种沉浸式反馈允许收集者主动识别潜在故障并聚焦于policy弱区域的数据收集,而无需物理机器人。此外,我们实现了一个异步的在线微调管道,不断使用新到的数据更新policy,实际上在分钟级别内关闭学习环路。广泛实验表明,RoboPocket遵循数据规模定律,数据效率是离线规模策略的两倍,克服了其长期存在的效率瓶颈。而且,我们的即时迭代环路在分布式环境中也提升了样本效率,最多可提高2倍。项目页面和视频:https://robo-pocket.github.io。

关键词

引用

@article{arxiv.2603.05504,
  title  = {RoboPocket: Improve Robot Policies Instantly with Your Phone},
  author = {Junjie Fang and Wendi Chen and Han Xue and Fangyuan Zhou and Tian Le and Yi Wang and Yuting Zhang and Jun Lv and Chuan Wen and Cewu Lu},
  journal= {arXiv preprint arXiv:2603.05504},
  year   = {2026}
}

备注

Project page: https://robo-pocket.github.io