预训练视觉模型用于机器人操作的无损适配
机器学习
2023-04-14 v1 计算机视觉与模式识别
机器人学
摘要
近期工作表明,在常见视觉学习任务上预训练的大模型可为广泛的专用感知问题以及多种机器人操作任务提供有用的表征。虽然先前关于机器人操作的工作主要使用冻结的预训练特征,但我们证明在机器人领域这种方法可能无法达到最优性能,而全模型微调可带来显著更好的结果。遗憾的是,微调会破坏预训练视觉表征,并导致表征向微调任务漂移,从而丧失原始模型的通用性。我们引入“无损适配”以解决经典微调的这一缺陷。我们证明,恰当放置我们的参数高效适配器可在不改变原始表征因而保留预训练模型原有能力的前提下,显著缩小冻结预训练表征与全端到端微调之间的性能差距。我们在三大主要模型架构(ViTs、NFNets 和 ResNets)、有监督(ImageNet-1K 分类)与自监督预训练权重(CLIP、BYOL、Visual MAE)上,跨 3 个任务领域和 35 项独立任务进行了全面研究,并证明我们的主张在各种设置下均得到有力验证。
引用
@article{arxiv.2304.06600,
title = {Lossless Adaptation of Pretrained Vision Models For Robotic Manipulation},
author = {Mohit Sharma and Claudio Fantacci and Yuxiang Zhou and Skanda Koppula and Nicolas Heess and Jon Scholz and Yusuf Aytar},
journal= {arXiv preprint arXiv:2304.06600},
year = {2023}
}
备注
ICLR'23, Project page see https://sites.google.com/view/robo-adapters/