对比性概念激活引导 (COAST):通过隐藏状态解锁视觉语言动作模型
机器人学
2026-05-19 v1 人工智能
机器学习
摘要
视觉语言动作 (VLA) 模型利用来自大规模视觉语言模型 (VLM) 预训练的强大感知先验,但在实际应用中仍然相当脆弱,经常在简单的机器人任务中失败。为缓解此问题,我们提出了对比性概念激活引导 (COAST)。COAST 基于“概念”这一概念,该概念是将数据软投射到目标分布主成分的线性算子。COAST 使用概念识别从成功和失败 rollout 中识别出特定机器人任务的关键成功子空间。在推理时,它将 VLA 隐层引导到这些识别出的成功子空间,以提高任务结果。对于三种架构上不同的神经策略(流匹配 VLA、自回归 VLA 和扩散策略),COAST 将绝对平均模拟和真实机器人任务成功率分别提高了超过 20% 和 40%。激活子空间几何学显示,失败模式在任务之间共享大量结构,而成功表示则在很大程度上保持任务特定。当任务共享相似的失败模式时,这一结构使先前拟合的概念能够在不重新拟合的情况下提高新任务的性能。最终,我们的结果表明当前的 VLA 仍保留了大量与任务相关的知识,其中的注意力专家的解码瓶颈可以通过将其残差流引导到任务相关子空间来缓解。COAST 提供了一种轻量级、无需训练的方式,通过引导模型向其自身的“成功”分布方向发挥作用,以释放这些潜在能力。
引用
@article{arxiv.2605.17144,
title = {Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States},
author = {Miranda Muqing Miao and Subin Kim and Brandon Yang and Lyle Ungar},
journal= {arXiv preprint arXiv:2605.17144},
year = {2026}
}
备注
Submitted to NeurIPS 2026