中文

Foundry:面向边缘设备的 3D 基础模型蒸馏

计算机视觉与模式识别 2026-03-27 v2 人工智能 机器学习 神经与进化计算

摘要

基于自监督学习(SSL)在大规模数据集上预训练的基础模型已成为强大的通用特征提取器。然而,其巨大规模和计算成本使其难以部署于机器人和 AR/VR 头显等边缘设备。现有压缩技术(如标准知识蒸馏)创建的高效“专家”模型会牺牲基础模型最为珍贵的、针对下游任务的agnostic 泛化能力。本文引入 Foundation Model Distillation(FMD),一种全新的压缩大型 SSL 模型为紧凑高效且忠实代理的范式,保留其通用表征能力。我们提出 Foundry,即 FMD 首个针对 3D 点云的实现。我们的做法训练学生模型学习压缩后的 SuperTokens,以重建教师模型的 token 级表示,捕获其潜在空间的紧凑基。单个蒸馏模型在 diverse 下游任务—分类、零件分割和 few-shot 场景—上保持强大的可迁移性,接近完整基础模型性能,同时使用显著更少的 token 和 FLOPs,使此类模型更实用地部署在资源受限硬件上。

关键词

引用

@article{arxiv.2511.20721,
  title  = {Foundry: Distilling 3D Foundation Models for the Edge},
  author = {Guillaume Letellier and Siddharth Srivastava and Frédéric Jurie and Gaurav Sharma},
  journal= {arXiv preprint arXiv:2511.20721},
  year   = {2026}
}

备注

Accepted at CVPR 2026