中文

KineVLA:面向运动学感知的视觉语言动作模型及双层动作分解

机器人学 2026-03-19 v1 人工智能

摘要

本文提出一种新颖的运动学丰富的视觉语言动作(VLA)任务,不同于现有的动作指令仅粗略或部分捕获运动学属性,本任务中语言指令在启动至完成的整个过程中,都稠密地编码了多样化的运动学属性(如方向、轨迹、姿态和相对位移),从而支持细粒度且个性化的操控。在此设置下,任务目标保持不变,而执行轨迹必须适应指令级别的运动学规范。为解决此挑战,我们提出KineVLA,一种视觉语言动作框架,通过双层动作表示和双层推理记忆串列地显式地将目标级别的不变性从运动学级别的可变性中解耦,充当显式的、受监督的中间变量,以对齐语言与动作。为支持此任务,我们构建了涵盖仿真和真实机器人平台的运动学感知VLA数据集,特点是指令级别的运动学变体及双层标注。在LIBERO和Realman-75机器人上的大量实验表明,KineVLA在运动学敏感基准测试中持续优于强大的VLA基线,实现了更精确、可控且可泛化的操控行为。

关键词

引用

@article{arxiv.2603.17524,
  title  = {KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition},
  author = {Gaoge Han and Zhengqing Gao and Ziwen Li and Jiaxin Huang and Shaoli Huang and Fakhri Karray and Mingming Gong and Tongliang Liu},
  journal= {arXiv preprint arXiv:2603.17524},
  year   = {2026}
}