通过 CPU-GPU 内存交换实现 Alpamayo 模型的无 OOM 推理
人工智能
2026-05-13 v1
摘要
用于自动驾驶的端到端视觉-语言-动作(VLA)模型将感知、推理和控制统一于单个神经网络中,实现了强大的驾驶性能,但需要 20-60GB 的 GPU 内存,远超商用 GPU 上 12-16GB 的可用容量。我们提出一个框架,仅通过系统级优化,无需修改模型,即可在显存受限的 GPU 上实现内存高效的 VLA 推理。我们的工作分三个阶段进行:(1)顺序需求分层将显存使用从模型级粒度降低到层级粒度;(2)流水线化需求分层通过传输-计算重叠,将参数传输时间隐藏在层执行时间内;(3)基于每模块驻留效益分析的 GPU 驻留层决策策略,消除了流水线无法隐藏的残余传输开销。我们进一步提出一个性能预测模型,通过单次性能分析运行即可确定最优配置——包括驻留层的数量和位置——且在所有配置下的预测误差低于 1.3%。将我们的工作应用于 RTX 5070Ti(16GB)上的 NVIDIA Alpamayo-R1-10B(21.52GB)模型,在保持全 BF16 精度的同时,实现了高达 3.55 倍于 Accelerate 卸载的加速。
引用
@article{arxiv.2605.11678,
title = {OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models},
author = {Seungwoo Roh and Huiyeong Kim and Jong-Chan Kim},
journal= {arXiv preprint arXiv:2605.11678},
year = {2026}
}
备注
Submitted to IEEE RTCSA on March 26, 2026 (KST); Accepted on May 4, 2026 (KST)