Transformer$^{-1}:资源受限部署的输入自适应计算
机器学习
2025-01-29 v1
摘要
针对深度学习模型在动态场景下固定计算范式造成的资源浪费问题,本文提出一种基于深度可适应性原则的Transformer架构。该架构通过建立计算复杂度与计算资源的联合优化模型,实现输入特征与计算资源之间的动态匹配。我们的核心贡献包括:(1)设计了两层控制机制,由复杂度预测器和强化学习策略网络组成,实现计算路径的端到端优化;(2)推导出动态计算的下界理论,证明了该系统的理论可达到最优效率;(3)提出层级折叠技术和CUDA Graph预编译方案,克服了动态架构的工程瓶颈。在ImageNet-1K基准测试中,我们的方法相对于标准Transformer减少42.7%的FLOPs,峰值内存使用降低34.1%,同时保持相当的准确率(±0.3%)。此外,我们在Jetson AGX Xavier平台上进行了实际部署,验证了该方法在资源受限环境中的有效性和实际价值。为进一步验证该方法的通用性,我们还在几个自然语言处理任务上进行了实验,显著改善了资源效率。
引用
@article{arxiv.2501.16394,
title = {Transformer^-1: Input-Adaptive Computation for Resource-Constrained Deployment},
author = {Lumen AI and Tengzhou No. 1 Middle School and Shihao Ji and Zihui Song and Fucheng Zhong and Jisen Jia and Zhaobo Wu and Zheyi Cao and Xu Tianhao},
journal= {arXiv preprint arXiv:2501.16394},
year = {2025}
}