面向半导体IC封装的视觉Transformer多轴架构-标记-位宽联合优化
计算机视觉与模式识别
2026-05-05 v1
摘要
视觉Transformer(ViT)在视觉识别中取得卓越成绩,但在资源受限的工业环境中仍受限于其高计算成本、内存需求和能源消耗。虽然神经网络架构搜索(NAS)、标记压缩和低精度推断等效率技术已广泛研究,但大多数先前工作仅针对单一优化轴,限制了整体部署收益且可能牺牲精度。本文提出首个实现三轴互补优化的综合框架:架构、标记和位宽。具体而言,框架通过神经网络架构搜索(AutoFormer)识别紧凑主干网络,通过标记合并(ToMe)降低信息处理需求,通过FP16混合精度推断加速每项操作。以DeiT-B/16基线为起点,首先在ImageNet-1K上分析激进压缩下的精度-效率权衡,然后将选定配置应用于实际的内部3D X射线半导体缺陷分类数据集,用于IC芯片封装检测。结果表明,所提出的多轴框架在吞吐量上实现10倍以上的提升,同时参数数量、FLOPs和能源消耗降低超过10倍,且保持下游工业任务所需精度。据我们了解,这是首个在ViT中联合优化架构、标记和位宽维度的工作,也是首个面向半导体制造的资源高效、面向部署的研究。
引用
@article{arxiv.2605.01742,
title = {Joint Architecture-Token-Bitwidth Multi-Axis Optimization of Vision Transformers for Semiconductor IC Packaging},
author = {Phat Nguyen and Xue Geng and Kaixin Xu and Wang Zhe and Xulei Yang and Ngai-Man Cheung},
journal= {arXiv preprint arXiv:2605.01742},
year = {2026}
}