中文

CF-VLA:面向视觉-语言-动作策略的高效粗到细动作生成

计算机视觉与模式识别 2026-04-29 v2 人工智能

摘要

基于流的视觉-语言-动作(VLA)策略为动作生成提供了强大的表达能力,但存在一个根本性的低效问题:需要多步推理才能从无信息量的高斯噪声中恢复动作结构,导致在实时约束下效率与质量的权衡较差。我们通过重新思考生成式动作建模中起点的作用来解决这一问题。我们提出了 CF-VLA,这是一种粗到细的两阶段公式化方法,它不缩短采样轨迹,而是将动作生成重构为一个构建动作感知起点的粗初始化步骤,随后进行一个单步局部细化以纠正残差。具体而言,粗阶段学习端点速度的条件后验,将高斯噪声转化为结构化初始化,而细阶段则从该初始化执行固定时间的细化。为了稳定训练,我们引入了一种分步策略,首先学习受控的粗预测器,然后进行联合优化。在 CALVIN 和 LIBERO 上的实验表明,我们的方法在低 NFE(函数评估次数)机制下确立了强大的效率-性能边界:它始终优于现有的 NFE=2 方法,在多项指标上匹配或超越了 NFE=10 的 π0.5\pi_{0.5} 基线,将动作采样延迟降低了 75.4%,并实现了 83.0% 的最佳平均真实机器人成功率,比 MIP 高出 19.5 个百分点,比 π0.5\pi_{0.5} 高出 4.0 个百分点。这些结果表明,结构化的粗到细生成能够同时实现强大的性能和高效的推理。我们的代码可在 https://github.com/EmbodiedAI-RoboTron/CF-VLA 获取。

关键词

引用

@article{arxiv.2604.24622,
  title  = {CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies},
  author = {Fan Du and Feng Yan and Jianxiong Wu and Xinrun Xu and Weiye Zhang and Weinong Wang and Yu Guo and Bin Qian and Zhihai He and Fei Wang and Heng Yang},
  journal= {arXiv preprint arXiv:2604.24622},
  year   = {2026}
}