将视觉-语言-动作模型引导为反探索:测试时缩放方法
机器人学
2025-12-03 v1 人工智能
摘要
视觉-语言-动作(VLA)模型通过流匹配或扩散目标训练,能够从大规模多模态数据(如人类遥操作、脚本化策略)中学习复杂行为。然而,由于VLAs在预训练阶段包含了多种数据模式,且微调数据集通常包含以运动学次优或不理想方式收集的演示数据,因此存在与下游任务成功动作模式无关的冗余动作模式。具体而言,我们观察到在预训练VLAs经过监督微调后,各种采样噪声在推理时存在关键的脆弱性。在本文中,我们将这种不稳定性归因于VLA策略与下游任务数据集的稳定成功模式所诱导策略之间的分布偏移。因此,我们提出了TACO,一个测试时缩放(TTS)框架,它应用轻量级伪计数估计器作为动作块的高保真验证器。集成TACO的VLA模型可以从所有采样动作块中执行具有最大伪计数的动作,从而在保留VLA泛化能力的同时防止分布偏移,因为约束仅在推理时应用。我们的方法类似于离线强化学习(RL)中的经典反探索原则,并且由于是无梯度的,与RL更新相比具有显著的计算优势,特别是对于由于去噪过程而难以执行RL更新的流或扩散型VLA。在四个仿真基准(RoboTwin2.0、Robotwin、LIBERO、SimplerEnv)和一个双臂平台上的广泛实验证明,我们的方法显著提高了推理稳定性和下游任务适应中的成功率。
引用
@article{arxiv.2512.02834,
title = {Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach},
author = {Siyuan Yang and Yang Zhang and Haoran He and Ling Pan and Xiu Li and Chenjia Bai and Xuelong Li},
journal= {arXiv preprint arXiv:2512.02834},
year = {2025}
}
备注
The first two authors contributed equally. Yang Zhang leads the whole project