中文

EdgeCrafter:通过任务专门化蒸馏实现边缘密集预测的紧凑 ViT

计算机视觉与模式识别 2026-03-30 v3

摘要

在资源受限的边缘设备上部署高性能密集预测模型仍具有挑战,因为计算和内存有严格限制。在实际应用中,针对目标检测、实例分割和姿态估计的轻量级系统仍由 CNN 架构主导,如 YOLO;而紧凑型 Vision Transformer(ViT)往往难以实现类似的精度-效率权衡,即使进行大规模预训练。我们认为,这一差距主要源于小规模 ViT 中缺乏足够的任务特定表征学习,而非 ViT 与边缘密集预测之间的本质性不匹配。为此,我们引入 EdgeCrafter,一个围绕 ECDet 的统一紧凑 ViT 框架,用于边缘密集预测,ECDet 基于蒸馏紧凑主干网络和面向边缘的编码器解码器设计。在 COCO 数据集上,ECDet-S 仅使用 COCO 标注即可实现 51.7 AP,参数不足 1000 万。对于实例分割,ECInsSeg 在参数大幅减少的情况下实现了与 RF-DETR 相当的性能。对于姿态估计,ECPose-X 达到 74.8 AP,显著优于 YOLO26Pose-X(71.6 AP)。这些结果表明,紧凑 ViT 在配合任务专门化蒸馏和面向边缘的设计后,可以成为边缘密集预测的实用且具竞争力的选项。代码已在项目网站上提供。

关键词

引用

@article{arxiv.2603.18739,
  title  = {EdgeCrafter: Compact ViTs for Edge Dense Prediction via Task-Specialized Distillation},
  author = {Longfei Liu and Yongjie Hou and Yang Li and Qirui Wang and Youyang Sha and Yongjun Yu and Yinzhi Wang and Peizhe Ru and Xuanlong Yu and Xi Shen},
  journal= {arXiv preprint arXiv:2603.18739},
  year   = {2026}
}

备注

Code is available at: https://intellindust-ai-lab.github.io/projects/EdgeCrafter/