BPP:通过聚焦关键历史帧实现长上下文机器人仿真学习
机器人学
2026-02-19 v2 机器学习
摘要
许多机器人任务需要关注过去观察的历史。例如,寻找房间中的物品需要记住哪些地方已经被搜索。然而,最佳表现的机器人策略通常仅基于当前观察进行条件化,限制了其在此类任务中的适用性。对过去观察进行条件化往往会因虚假关联而失败:策略会捕捉到训练历史中偶然特征,这些特征在部署时不会在分布外轨迹中 generalization。我们分析了为什么策略会捕捉这些虚假关联,发现问题源于训练期间对可能历史空间的覆盖不足,这会随时间步长呈指数增长。现有的正则化技术在不同任务间提供的一致收益有限,因为它们并未根本解决覆盖问题。受此启发,我们提出了大局策略(BPP),一种基于视觉语言模型检测关键帧的方法,条件化于最小集合中的有意义关键帧。通过将多样化的 rollout 投影到任务相关事件的紧凑集合,BPP 大幅减少了训练与部署之间的分布迁移,同时不牺牲表达能力。我们在四个具有挑战性的真实世界操控任务和三个仿真任务上进行评估,所有任务都需要历史条件化。BPP 在真实世界评估中比最佳对比方法 achieves 70% 更高的成功率。视频可在 https://bigpicturepolicies.github.io/ 查看。
引用
@article{arxiv.2602.15010,
title = {BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames},
author = {Max Sobol Mark and Jacky Liang and Maria Attarian and Chuyuan Fu and Debidatta Dwibedi and Dhruv Shah and Aviral Kumar},
journal= {arXiv preprint arXiv:2602.15010},
year = {2026}
}