中文

基于区域兴趣(ROI)驱动的视觉语言动作系统统一异观表示

机器人学 2026-03-24 v1

摘要

具身 AI 系统的开发日益受限于物理交互数据的可用性与结构。尽管近期在视觉语言动作(Vision-Language-Action, VLA)模型方面取得了进展,当前管道仍面临高的数据收集成本、跨具身对齐有限以及从 internet 规模的视觉数据到机器人控制的迁移效果差的问题。我们提出一种基于区域兴趣(ROI)驱动的工程工作流程,引入以人为中心、几何 grounding 的数据表示。通过将机械臂端效ector pose 通过正向运动学(Forward Kinematics, FK) 投影到单个外部摄像机,我们推导出与运动对齐的人-centric ROI,而无需佩戴手腕摄像头或多视角系统。与直接对整个画面进行下采样不同,ROI 是从原始图像中裁剪而来,然后进行缩放,这既保留了接触关键区域的高局部信息密度,又保留了全局上下文。我们呈现一个可复现的管道,涵盖标定、同步、ROI 生成、确定性边界处理以及元数据治理。最终得到的表示是具身对齐且视点归一化的,能够实现跨异构机器人的物理数据复用。我们认为,人-centric ROI 作为一种实用的抽象,具有可扩展的数据收集和跨具身学习的潜力,正在搭建桥梁,将 internet 规模的感知与机器人专用控制相连接。

关键词

引用

@article{arxiv.2603.20668,
  title  = {ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems},
  author = {Xinhai Sun and Xiang Shi and Menglin Zou and Wenlong Huang},
  journal= {arXiv preprint arXiv:2603.20668},
  year   = {2026}
}