中文

基于流匹配似然估计的延迟鲁棒执行:DEFLECT 用于 VLA 策略的反事实调优

机器人学 2026-05-20 v1 人工智能

摘要

视觉语言-动作 (VLA) 策略通常以异步推理部署:机器人在模型计算下一个动作块时执行先前预测的动作块。这导致预测-执行错位:该动作块基于推理开始前的观察条件化,但在物理状态已漂移多个控制步骤后执行;在 Kinetix 上,简单地进行异步循环会从 89% 降至不到 1%。我们引入 DEFLECT,这是一种完全离线的后训练细化方法,可作为现有异步 VLA 堆栈的近乎即插即用的升级,通过将延迟本身转化为无标签的偏好信号来实现:从冻结的参考策略中构建新的/陈旧动作对,并通过部署时的条件化对其进行评分,使用隐式流匹配似然比值替代方案,无需人工标签、奖励模型或在线 rollout。DEFLECT 大大扩展了异步 VLA 控制的可用延迟范围,在高延迟 regime (5-7 个控制步骤) 获得 +6.4 的成功率提升,在最长延迟下迁移到真实规模 VLA 时提升 +4.6,并在两个真实机器人任务上 consistently 获得改进 (双手传送夹取和反应式打击地鼠)。

关键词

引用

@article{arxiv.2605.19294,
  title  = {DEFLECT: Delay-Robust Execution via Flow-matching Likelihood-Estimated Counterfactual Tuning for VLA Policies},
  author = {Yixiang Zhu and Yonghao Chen and Rui Meng and Jingyu Guo and Jiaxiang Zou and Zijie Yang and Taowen Wang and Xinyu Chen},
  journal= {arXiv preprint arXiv:2605.19294},
  year   = {2026}
}