CLARE:通过自主适配器路由与扩展实现视觉-语言-动作模型的持续学习
机器人学
2026-05-18 v2 机器学习
摘要
为了教会机器人复杂的操作任务,一种常见的方法是在任务特定数据上微调预训练的视觉-语言-动作模型(VLA)。然而,由于这种方法会更新现有的表示,因此它不适合在现实世界中进行长期操作,因为在现实世界中,机器人必须持续适应新任务和新环境,同时保留已获得的知识。现有的机器人持续学习方法通常需要存储先前的数据(样本),难以处理长任务序列,或依赖于任务标识符进行部署。为了解决这些限制,我们提出了CLARE,这是一个通用的、参数高效的框架,用于实现基于VLA的无样本持续学习。CLARE将轻量级的模块化适配器引入选定的VLA模块,并在学习新任务时,以逐层特征相似性为指导,仅在必要时自主扩展模型。在部署期间,一个基于自编码器的路由机制动态激活最相关的适配器,而无需任务标签。通过在LIBERO基准测试和五个真实世界任务上的大量实验,我们表明CLARE在新任务上实现了高性能,且没有灾难性地遗忘早期任务,其性能显著优于甚至基于样本的方法。代码、数据和视频可在我们的网站上获取:https://tum-lsy.github.io/clare。
引用
@article{arxiv.2601.09512,
title = {CLARE: Continual Learning for Vision-Language-Action Models via Autonomous Adapter Routing and Expansion},
author = {Ralf Römer and Yi Zhang and Yuming Li and Angela P. Schoellig},
journal= {arXiv preprint arXiv:2601.09512},
year = {2026}
}
备注
Accepted to IEEE Robotics and Automation Letters 2026. Project page: https://tum-lsy.github.io/clare. 11 pages, 9 figures