面向通用机器人的绿色-VLA:分阶段视觉-语言-动作模型
信号处理
2026-02-03 v1
摘要
我们介绍Green-VLA,这是一个面向绿色人oid机器人实�践部署的分阶段视觉-语言-动作(VLA)框架,同时保持跨不同机体的泛化能力。Green-VLA遵循五阶段课程:(L0)基础视觉-语言模型,(L1)多模态对齐,(R0)跨机体预训练,(R1)机体特定适配,以及(R2)强化学习(RL)策略对齐。我们将可扩展的数据处理管道(3000小时示范数据)与时间对齐和质量过滤相结合,使用统一的、面向机体的动作接口,使单个策略能够控制人oid、移动操作机械臂和固定基座机械臂。在推断阶段,VLA控制器通过剧情进度预测、离群检测和基于关节预测的引导进行增强,以提高安全性和精确的目标选择。在Simpler BRIDGE WidowX和CALVIN ABC-D上的实验,以及实际机器人评估显示,强大的泛化能力和来自RL对齐的性能提升在成功率、鲁棒性和长期任务效率方面均取得显著提升。
引用
@article{arxiv.2602.00917,
title = {mmWave Sensing for Detecting Movement Through Thermoplastic Masks During Radiation Therapy Treatment},
author = {Ali Kourani and Naveed A. Abbasi and Syeda Narjis Fatima and Katsuyuki Haneda and Andreas F. Molisch},
journal= {arXiv preprint arXiv:2602.00917},
year = {2026}
}
备注
5 pages, 6 figures. Conference paper