面向 AI-RAN 网络的自适应 Swin Transformer 分区
网络与互联网体系结构
2026-04-28 v1
摘要
本文演示了基于 Transformer 的 split inference 在动态 5G AI-RAN 网络上实现实时视频目标检测的可行性。我们将吞吐量感知的自适应分段技术从 CNN 扩展至 Swin Transformer 主干,表明无需重新训练即可实现 Transformer 基础视觉模型的实用分段执行。为解决 Transformer 固有的大中间激活问题,我们引入一种高效且保持精度的激活压缩管道,显著降低上行业务负载。完整系统包括自适应分段选择、Transformer 推理和压缩,已在真实时间检测工作负载上端到端实现和验证,分布式 UPF (dUPF) 集成进一步降低用户面延迟并提升运行时稳定性。在 NVIDIA Aerial 基础的 AI-RAN 测试平台上进行大规模实测,综合考虑推理和 5G 通信能耗,量化了实际部署中的延迟、能耗与隐私权衡。
引用
@article{arxiv.2604.23554,
title = {Adaptive Swin Transformer Partitioning over AI-RAN Networks},
author = {Tam Thanh Nguyen and Yong Hao Pua and Tuan Van Ngo and Mao V. Ngo and Jihong Park and Binbin Chen and Tony Q. S. Quek},
journal= {arXiv preprint arXiv:2604.23554},
year = {2026}
}
备注
6 pages. Accepted version for presentation at the 2026 IEEE Vehicular Technology Conference (VTC2026-Spring), Nice, France 9 - 12 June 2026. copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses