桥接语言、视觉与动作:机器人操作任务中的多模态 VAE
机器人学
2025-05-29 v2 机器学习
摘要
在这项工作中,我们专注于机器人操作领域的无监督视觉-语言-动作映射。最近,已有多种采用预训练大型语言和视觉模型的方法被提出用于该任务。然而,这些方法计算需求高,并且需要对生成的输出进行仔细的微调。一种更轻量级的替代方案是实现多模态变分自编码器(VAE),它可以提取数据的潜在特征并将其整合到联合表示中,正如在最先进的模型中主要在图像-图像或图像-文本数据上所展示的那样。在这里,我们探讨了在模拟环境中的无监督机器人操作任务中是否以及如何采用多模态 VAE。基于所获得的结果,我们提出了一种模型不变的训练替代方案,在模拟器中将模型的性能提升了高达 55%。此外,我们系统地评估了各项任务带来的挑战,例如物体或机器人位置的可变性、干扰项的数量或任务长度。因此,我们的工作还揭示了使用当前多模态 VAE 基于视觉和语言进行机器人运动轨迹无监督学习的潜在益处与局限性。
关键词
引用
@article{arxiv.2404.01932,
title = {Bridging Language, Vision and Action: Multimodal VAEs in Robotic Manipulation Tasks},
author = {Gabriela Sejnova and Michal Vavrecka and Karla Stepanova},
journal= {arXiv preprint arXiv:2404.01932},
year = {2025}
}
备注
7 pages, 5 figures, 2 tables, conference