分层知识密度超网络用于可扩展视觉Transformer
机器学习
2025-11-18 v1 人工智能
计算机视觉与模式识别
摘要
训练和部署面向不同资源约束的多个视觉Transformer(ViT)模型成本高昂且效率低下。为此,我们提出将预训练ViT转化为分层知识密度超网络,知识在权重中进行层次化组织。这使得能够灵�提取保留最大知识量的子网络,以适应不同模型规模。我们引入加权PCA用于注意力收缩(WPAC),将知识浓缩到紧凑的关键权重集合中。WPAC对中间特征应用基于token的加权主成分分析,并将结果变换矩阵和逆矩阵注入相邻层,既保留原始网络功能,又提升知识紧凑性。为进一步促进分层知识组织,我们提出渐进重要性感知Dropout(PIAD)。PIAD逐步评估权重组的重要性,更新重要性感知Dropout列表,并在此Dropout方案下训练超网络,以促进知识分层。实验表明,WPAC在知识浓缩方面优于现有剪枝标准,与PIAD的结合为模型压缩和模型扩展提供了强有力的替代方案。
关键词
引用
@article{arxiv.2511.11683,
title = {Stratified Knowledge-Density Super-Network for Scalable Vision Transformers},
author = {Longhua Li and Lei Qi and Xin Geng},
journal= {arXiv preprint arXiv:2511.11683},
year = {2025}
}
备注
Accepted by AAAI 2026