CLAW:面向重量感知的视觉-语言-动作框架用于机器人抓取
机器人学
2025-09-18 v1
摘要
视觉-语言-动作(VLA)模型最近涌现出作为机器人控制的有前景的方法,使能够实现将自然语言指令 grounding 到视觉-运动动作的端到端策略。然而,当前的 VLA 模型常常难以满足精确的任务约束,例如基于数值阈值的停止条件,因为其观察-动作映射是隐式地由训练数据塑造的,缺乏条件监控的显式机制。本文提出 CLAW(CLIP-Language-Action for Weight,CLIP 语言-动作用于重量),一个能够解耦条件评估与动作生成的框架。CLAW 利用微调的 CLIP 模型作为轻量级提示生成器,持续监控称数读数并根据任务特定的重量阈值生成离散指令。这些提示随后被消费于 ,这是一种基于流的 VLA 策略,它将这些提示与多视角相机观察集成,以产生连续的机器人动作。这种设计使 CLAW 能够将符号化的重量推理与高频率的视觉-运动控制相结合。我们在三个实验场景上对 CLAW 进行了验证:单物体抓取以及需要双臂操作的混合物体任务。在所有条件下,CLAW 都可靠地执行了重量感知行为,并优于原始 和微调后的 模型。我们已将视频作为补充材料上传载。
引用
@article{arxiv.2509.14143,
title = {CLAW: A Vision-Language-Action Framework for Weight-Aware Robotic Grasping},
author = {Zijian An and Ran Yang and Yiming Feng and Lifeng Zhou},
journal= {arXiv preprint arXiv:2509.14143},
year = {2025}
}
备注
8 pages, 5 figures, 1 table