潜在策略障碍:通过保持在分布内学习稳健视觉运动策略
机器人学
2025-08-11 v1
摘要
通过行为克隆训练的视觉运动策略对协变量漂移十分脆弱,其中小偏差从专家轨迹中可以叠加成失败。常见的缓解策略包括通过人类在回路中的纠正或合成数据扩充来扩充训练分布。然而,这些方法往往在劳动密集、依赖强任务假设或牺牲仿照质量方面具有不足。我们引入 Latent Policy Barrier,一种稳健视觉运动策略学习框架。灵感来自 Control Barrier Functions,LPB 将专家演示的潜在嵌入视为生成稳健、在分布内状态与不稳健、在分布外(OOD)状态之间的隐式障碍。我们的做法将精确的专家仿照和 OOD 恢复的角色分离为两个独立模块:一个仅基于专家数据的基础扩散策略,以及一个在专家和次优策略 rollout 数据上训练的 dynamics 模型。在推断时,dynamics 模型预测未来潜在状态并优化它们以保持在 expert 分布内。模拟和实际实验都表明,LPB 在策略稳健性和数据效率方面都取得了改善,使我们能够仅凭有限的专家数据即可实现可靠的操纵,而无需额外的人类纠正或标注。
引用
@article{arxiv.2508.05941,
title = {Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution},
author = {Zhanyi Sun and Shuran Song},
journal= {arXiv preprint arXiv:2508.05941},
year = {2025}
}