BORA:桥接离线强化学习与在线残差适应用于真实世界灵巧 VLA 模型
机器学习
2026-05-29 v1
摘要
视觉-语言-动作(VLA)模型已成为将视觉-语言理解 grounding 到真实世界机器人操作中的有前景的方法。然而,由于高维手部控制和执行误差的叠加,灵巧操作对 VLA 策略仍具有挑战性,这使得针对将视觉-语言动作生成与实际可靠灵巧执行桥接的真实世界 RL post-training 至关重要。然而,高维灵巧探索往往会触发时序不一致、样本效率低和硬件风险。为解决这些挑战,我们提出 BORA,这是一个为真实世界灵巧 VLA 模型设计的离线到在线 RL post-training 框架。在离线阶段,BORA 构建一个接受 VLM 的认知 token 和动作块作为输入的 critic。这种设计使 critic 能够获得基于动作的价值导向,允许其评估仅凭视觉上下文无法捕捉的灵巧手部动作。在随后的在线阶段,BORA 冻结 VLA 基础模型,引入轻量级的人类在环(HiL)块级残差适应机制以缓解真实世界执行误差并进一步纠正离线学习的意图 within 实际物理环境。通过继承离线 critic 并采用干预驱动的奖励,BORA 有效纠正了执行差异并适应真实世界的物理变化,同时保持预训练策略作为稳定的先验。广泛的评估表明,在五个复杂的真实世界灵巧任务中,BORA 在标准设置下显著优于纯模仿学习和传统解耦 RL 基准,平均成功率提升 33 个百分点,在未见对象泛化上提升最高可达 43%。
引用
@article{arxiv.2605.30225,
title = {ExDBSCAN: Explaining DBSCAN with Counterfactual Reasoning -- Additional Material},
author = {Pernille Matthews and Lena Krieger and Tommaso Amico and Artur Zimek and Thomas Seidl and Ira Assent},
journal= {arXiv preprint arXiv:2605.30225},
year = {2026}
}