Neuron Chunking:面向 Vision-Language Model 的 I/O 高效稀疏化
机器学习
2025-11-25 v1 人工智能
计算机视觉与模式识别
性能
摘要
大型视觉语言模型 (VLM) 的边缘部署日益依赖基于闪存的权重卸载,其中激活稀疏化用于减少 I/O 开销。然而,传统稀疏化方法仍以模型为中心,仅依据激活幅值选择神经元,忽略了访问模式对闪存性能的影响。我们提出了 Neuron Chunking,一种基于块 (即内存中连续神经元组) 的 I/O 高效稀疏化策略,将神经元重要性与存储访问成本耦合。该方法通过对访问连续性的轻量抽象建模 I/O 延迟,并选择具有高效用的块,即神经元重要性归一化后估计的延迟。通过将稀疏化决策与底层存储行为对齐,Neuron Chunking 在 Jetson Orin Nano 和 Jetson AGX Orin 上分别将 I/O 效率提高最高可达 4.65 倍和 5.76 倍。
引用
@article{arxiv.2511.18692,
title = {VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking},
author = {Kichang Yang and Seonjun Kim and Minjae Kim and Nairan Zhang and Chi Zhang and Youngki Lee},
journal= {arXiv preprint arXiv:2511.18692},
year = {2025}
}