中文

ARMADA:自主在线故障检测与人类共享控制赋能可扩展的现实部署与适应

机器人学 2025-10-03 v1

摘要

模仿学习在从大规模真实世界数据集中学习方面显示出前景。然而,预训练的策略通常缺乏足够的领域内数据。此外,人类收集的演示涉及大量劳动,往往包含混合质量的数据和冗余信息。作为一种变通方法,人类在环系统收集特定领域的数据进行策略后训练,利用闭环策略反馈提供有用的指导,但通常需要在策略部署期间全程人类监视。在本工作中,我们构思了 ARMADA,一个具有人类在环共享控制的多机器人部署和适应系统, featuring 一种名为 FLOAT 的自主在线故障检测方法。得益于 FLOAT,ARMADA 实现了并行的策略部署,仅在必要时请求人类干预,显著减少了对人类的依赖。因此,ARMADA 实现了领域内数据的高效获取,导致更可扩展的部署和对新情景的更快适应。我们在四个真实世界任务上评估了 ARMADA 的性能。FLOAT 在平均准确率上接近 95%,超越了以往最先进的故障检测方法超过 20%。此外,ARMADA 在多个策略部署和后训练轮次中相较于以往的人类在环学习方法实现了超过 4 倍的成功率和超过 2 倍的人类干预率降低。

关键词

引用

@article{arxiv.2510.02298,
  title  = {ARMADA: Autonomous Online Failure Detection and Human Shared Control Empower Scalable Real-world Deployment and Adaptation},
  author = {Wenye Yu and Jun Lv and Zixi Ying and Yang Jin and Chuan Wen and Cewu Lu},
  journal= {arXiv preprint arXiv:2510.02298},
  year   = {2025}
}