Robo-MUTUAL: 基于单模态学习的机器人多模态任务规格
机器人学
2024-10-03 v1 计算机视觉与模式识别
摘要
多模态任务规格对增强机器人性能至关重要,其中 Cross-modality Alignment 使机器人能够全面理解复杂任务指令。直接为模型训练标注多模态指令在数据稀缺的 paired multimodal data 条件下难以实现。本研究表明,通过利用在真实数据中丰富的单模态指令,可有效教导机器人学习多模态任务规格。首先,我们通过在大量域外数据上预训练机器人多模态编码器,赋予机器人强大的 Cross-modality Alignment 能力。随后,采用两个 Collapse and Corrupt 操作进一步弥合所学习多模态表征之间的剩余模态差距。该方法将相同任务目标的不同模态投射为可互换的表征,从而在已对齐的多模态潜在空间中实现精准的机器人操作。在超过 130 项任务和 4000 次评估中,本研究提出的框架在模拟 LIBERO benchmark 和真实机器人平台上均展示了卓越的性能,显著克服了机器人学习中数据约束的限制。网站: zh1hao.wang/Robo_MUTUAL
引用
@article{arxiv.2410.01529,
title = {Robo-MUTUAL: Robotic Multimodal Task Specification via Unimodal Learning},
author = {Jianxiong Li and Zhihao Wang and Jinliang Zheng and Xiaoai Zhou and Guanming Wang and Guanglu Song and Yu Liu and Jingjing Liu and Ya-Qin Zhang and Junzhi Yu and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2410.01529},
year = {2024}
}
备注
preprint