CRAFT:通过力觉课程微调适配接触丰富操作的VLA模型
机器人学
2026-02-16 v1
摘要
视觉-语言-动作(Vision-Language-Action,VLA)模型已显示出在执行通用指令方面具有强大的能力,但在接触丰富的操作任务中却难以胜任,这类任务成功需要精确的对齐、稳定的接触维持以及有效处理可变形物体的能力。一个根本性的挑战在于,高熵的视觉与语言输入与低熵但关键的力觉信号之间的不平衡,往往导致对感知的过度依赖和控制不稳定。为此,我们引入CRAFT(Constraint-Rectified Training for Efficient Chain-of-Thought的适配方案),一个力觉感知课程微调框架,集成变分信息瓶颈模块,以调节早期训练中的视觉和语言嵌入。这种课程策略鼓励模型最初优先关注力觉信号,然后逐步恢复对完整多模态信息的访问。为实现力觉感知学习,我们进一步设计了一个同源领袖-跟随式遥操作系统,跨越多种接触丰富任务收集同步的视觉、语言和力觉数据。真实世界的实验表明,CRAFT在提升任务成功率、泛化到未见物体和新任务变体方面,以及在多种VLA架构之间实现有效适应方面均表现出色,使接触丰富的操作得以稳健且可泛化。
引用
@article{arxiv.2602.12532,
title = {CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning},
author = {Yike Zhang and Yaonan Wang and Xinxin Sun and Kaizhen Huang and Zhiyuan Xu and Junjie Ji and Zhengping Che and Jian Tang and Jingtao Sun},
journal= {arXiv preprint arXiv:2602.12532},
year = {2026}
}