VER:基于基础模型蒸馏与动态路由的机器人学习视觉专家 Transformer
机器人学
2026-05-15 v2 人工智能
机器学习
摘要
预训练视觉基础模型 (VFM) 通过丰富的视觉表示推进了机器人学习,然而单个 VFM 通常仅在特定领域表现出色,限制了其在跨任务中的通用性。将多个 VFM 蒸馏为用于策略的统一表示可以缓解这一局限性,但往往导致僵化的任务特定特征选择,并且需要昂贵的全量重新训练以融入机器人领域知识。我们提出了 VER,一种用于机器人学习的视觉专家 Transformer。在预训练阶段,VER 将多个 VFM 蒸馏为一个视觉专家库。随后,它仅微调一个轻量级路由网络(参数量不到 0.4%),以便为下游机器人任务从预训练库中动态选择任务相关的专家。我们进一步引入了结合课程 Top-K 退火的逐块专家路由,以提高动态专家选择的灵活性与精度。此外,VER 支持参数高效微调,以实现可扩展的专家利用和自适应的机器人领域知识整合。在 17 项多样的机器人任务和多个策略头上,VER 取得了 SOTA 性能。我们发现 VER 减少了任务无关区域(如背景)中的大范数异常值,并聚焦于任务关键区域。可视化与代码可在 https://yixiaowang7.github.io/ver_page/ 获取。
关键词
引用
@article{arxiv.2510.05213,
title = {VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing},
author = {Yixiao Wang and Mingxiao Huo and Zhixuan Liang and Yushi Du and Lingfeng Sun and Haotian Lin and Jinghuan Shang and Chensheng Peng and Mohit Bansal and Mingyu Ding and Masayoshi Tomizuka},
journal= {arXiv preprint arXiv:2510.05213},
year = {2026}
}