中文

平静的海面造就不出熟练的水手:通过学习搜索实现鲁棒模仿

机器学习 2025-10-27 v2

摘要

行为克隆(BC)方法在模仿学习中的根本局限性在于,它只教会智能体专家在专家访问过的状态下所做的事情。这意味着当BC智能体犯错并脱离演示数据的支撑集时,它们往往不知道如何恢复。从这个意义上说,BC类似于给智能体鱼——在狭窄的状态集上提供密集的监督——而不是教它们捕鱼:即使在面对测试时的未见情况,也能独立推理以实现专家结果。作为回应,我们探索从专家演示中学习搜索(L2S),即学习所需的组件,以便在测试时规划匹配专家结果,即使在犯错之后。这些组件包括(1)世界模型和(2)奖励模型。我们仔细剥离了将这些和其他组件结合所需的算法和设计决策,以实现稳定且样本/交互高效的恢复行为学习,而无需额外的人工纠正。在来自三个基准的十几个视觉操作任务上,我们的方法SAILOR始终优于通过BC在相同数据上训练的最新扩散策略。此外,将用于BC的演示数量增加5-10倍仍然存在性能差距。我们发现SAILOR能够识别细微的失败,并且对奖励黑客攻击具有鲁棒性。我们的代码可在 https://github.com/arnavkj1995/SAILOR 获取。

关键词

引用

@article{arxiv.2506.05294,
  title  = {A Smooth Sea Never Made a Skilled SAILOR: Robust Imitation via Learning to Search},
  author = {Arnav Kumar Jain and Vibhakar Mohta and Subin Kim and Atiksh Bhardwaj and Juntao Ren and Yunhai Feng and Sanjiban Choudhury and Gokul Swamy},
  journal= {arXiv preprint arXiv:2506.05294},
  year   = {2025}
}