RoboAct-CLIP:面向机器人原子动作理解的视频驱动预训练
机器人学
2025-04-04 v1 人工智能
机器学习
摘要
视觉语言模型(VLMs)已成为机器人系统的关键工具,通过多模态感知和语义推理实现跨任务泛化、动态环境交互和长时程规划。然而,现有主要针对通用视觉-语言对齐任务训练的开源 VLMs 未能有效建模对机器人操作至关重要的、具有时间相关性的动作语义。尽管当前基于图像的微调方法部分地将 VLMs 适配于机器人应用,但它们从根本上忽略了视频序列中的时间演化模式,并存在机器人智能体、被操作物体和环境上下文之间视觉特征纠缠的问题,从而限制了对原子动作的语义解耦能力并损害了模型的泛化性。为了克服这些挑战,本文提出了 RoboAct-CLIP,具有两项技术贡献:1)一个数据集重构框架,对开源机器人视频执行语义约束的动作单元分割和重新标注,构建包含单一原子动作(例如“抓取”)的纯净训练集;2)一种基于对比语言-图像预训练(CLIP)架构的时间解耦微调策略,将跨视频帧的时间动作特征与以物体为中心的特征解耦,实现机器人原子动作的层次化表示学习。在模拟环境中的实验结果表明,RoboAct-CLIP 预训练模型的成功率比基线 VLMs 高 12%,并在多物体操作任务中展现出卓越的泛化能力。
引用
@article{arxiv.2504.02069,
title = {RoboAct-CLIP: Video-Driven Pre-training of Atomic Action Understanding for Robotics},
author = {Zhiyuan Zhang and Yuxin He and Yong Sun and Junyu Shi and Lijiang Liu and Qiang Nie},
journal= {arXiv preprint arXiv:2504.02069},
year = {2025}
}
备注
IROS 2025