面向视觉-运动学习的跨架构视觉蒸馏
计算机视觉与模式识别
2026-01-19 v1 人工智能
摘要
视觉-运动策略常常利用大规模预训练的视觉转换器(ViT)以发挥其强大的泛化能力。然而,这些方法对数据的显著需求在大多数机器人学习场景中数据稀缺的环境中构成了主要挑战,而紧凑且具备强归纳偏置的卷积神经网络(CNN)则更易于优化。为此,我们提出了 X-Distill,即一种简单且高度有效的跨架构视觉蒸馏方法,融合了两种架构的优势。我们的方法通过离线的跨架构知识蒸馏,将大型冻结 DINOv2 教师在通用 ImageNet 数据集上获得的丰富视觉表征,蒸馏到紧凑的 ResNet-18 学生网络中。该蒸馏后的编码器现在具备了强大的视觉先验知识,随后将其与扩散策略头联合在目标操作任务上进行微调。针对 34 个仿真基准和 5 个具有挑战性的实际任务进行了广泛实验,表明我们的方法在配备来自 ImageNet 数据集上蒸馏的 ResNet 或微调 DINOv2 编码器的策略方面 consistently 优于采用零头 ResNet 或微调 DINOv2 编码器的策略。更进一步,X-Distill 还超过了利用特权点云观察或 much larger Vision-Language Models 的 3D 编码器。我们的工作凸显了一种简单且基于良好理论的蒸馏策略在数据高效机器人操作中实现最先进性能的有效性。
引用
@article{arxiv.2601.11269,
title = {X-Distill: Cross-Architecture Vision Distillation for Visuomotor Learning},
author = {Maanping Shao and Feihong Zhang and Gu Zhang and Baiye Cheng and Zhengrong Xue and Huazhe Xu},
journal= {arXiv preprint arXiv:2601.11269},
year = {2026}
}