Agile-VLA:基于隐式 affordance 锚定的少样本工业姿态校正
机器人学
2026-03-25 v1
摘要
在资源受限的边缘平台上部署视觉-语言-动作 (VLA) 模型时,面临高延迟语义推理与动态操作所需的高频控制之间的根本性冲突。为解决这一挑战,本文提出了 Agile-VLA,一个为边缘设备(如 NVIDIA Jetson Orin Nano)上的工业姿态重定向任务设计的分层框架。核心创新是隐式 affordance 锚定机制,直接将几何视觉线索(specifically centroid 和 rim 关键点锚点)映射到结构化的参数化动作原语,从而大大减少了在闭环控制期间对高延迟语义推理的依赖。通过一种异步双流架构将感知 (10 Hz) 与控制 (50 Hz) 解耦,该系统有效缓解了边缘机器人学习中固有的频率失调。在标准 6 自由度操作机械臂上的实验结果表明,Agile-VLA 仅通过 5 -shot demonstration 即可通过外延灵活性实现对复杂不规则工作件的稳健姿态校正。
引用
@article{arxiv.2603.22899,
title = {Agile-VLA: Few-Shot Industrial Pose Rectification via Implicit Affordance Anchoring},
author = {Teng Yan and Zhengyang Pei and Chengyu Shi and Yue Yu and Yikun Chen and Zilong Zhu and Zelin Fang and Kaile Guo and Zihang Wang and Peigen Tian and Bingzhuo Zhong},
journal= {arXiv preprint arXiv:2603.22899},
year = {2026}
}
备注
8 pages. Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026