基于差异引导的 DiG-Flow 流匹配方法以提升 VLA 模型鲁棒性
机器人学
2025-12-02 v1
摘要
使用流匹配训练的视觉-语言-动作(Vision-Language-Action, VLA)模型在机器人操作任务上表现突出,但在分布迁移和复杂多步骤任务下性能常下降,表明所学表示可能不健全地捕获任务相关语义。我们引入 DiG-Flow,一种以几何正则化增强 VLA 鲁棒性的框架。我们的关键洞察是:观测嵌入与动作嵌入之间的分布差异提供了有意义的几何信号——传输成本越低,表征越匹配;成本越高,则暗示潜在错位。DiG-Flow 计算观测嵌入与动作嵌入经验分布之间的差异度量,将其映射为调制权重,通过单调函数应用于流匹配前的观测嵌入残差更新。关键在于,这一干预在表示层面操作,不修改流匹配路径或目标向量场。我们提供理论保证,表明差异引导的训练可证明地降低训练目标,引导推理细化收敛且具有收缩性。实验表明,DiG-Flow 可无显著开销地集成到现有 VLA 架构中,并在各种任务上一致提升性能,尤其在复杂多步骤任务和训练数据有限时收益尤为显著。
引用
@article{arxiv.2512.01715,
title = {DiG-Flow: Discrepancy-Guided Flow Matching for Robust VLA Models},
author = {Wanpeng Zhang and Ye Wang and Hao Luo and Haoqi Yuan and Yicheng Feng and Sipeng Zheng and Qin Jin and Zongqing Lu},
journal= {arXiv preprint arXiv:2512.01715},
year = {2025}
}