中文

基于少量样本演示的视觉-语言-动作模型机械化微调

机器人学 2025-12-01 v1 计算与语言 计算机视觉与模式识别

摘要

视觉-语言-动作 (VLA) 模型承诺将视觉-语言模型 (VLM) 在机器人领域取得的显著成功扩展到机器人领域。然而,与视觉-语言领域的 VLM 不同,面向机器人的 VLA 需要通过微调来应对机器人本体、环境特征以及每个任务的空间关系等变化。现有的微调方法缺乏针对性,无论任务的视觉、语言还是物理特征,都采用相同的参数组合。灵感来自神经科学中的功能特化假设,我们推测针对特定任务微调稀疏模型表示会更有效。本文引入了 Robotic Steering,一种基于机械可解释性的微调方法,利用少量样本演示识别并 selectively 微调与机器人任务物理、视觉和语言要求相匹配的注意力头。通过在 Franka Emika 机器人臂上的全面机器人评估,我们展示了 Robotic Steering 在 LoRA 之上 outperforming,同时在任务变化下的鲁棒性更好、计算成本更低、可解释性更强,从而更好地适应多样化的机器人任务。

关键词

引用

@article{arxiv.2511.22697,
  title  = {Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations},
  author = {Chancharik Mitra and Yusen Luo and Raj Saravanan and Dantong Niu and Anirudh Pai and Jesse Thomason and Trevor Darrell and Abrar Anwar and Deva Ramanan and Roei Herzig},
  journal= {arXiv preprint arXiv:2511.22697},
  year   = {2025}
}