中文

Neuron Chunking:面向 Vision-Language Model 的 I/O 高效稀疏化

机器学习 2025-11-25 v1 人工智能 计算机视觉与模式识别 性能

摘要

大型视觉语言模型 (VLM) 的边缘部署日益依赖基于闪存的权重卸载,其中激活稀疏化用于减少 I/O 开销。然而,传统稀疏化方法仍以模型为中心,仅依据激活幅值选择神经元,忽略了访问模式对闪存性能的影响。我们提出了 Neuron Chunking,一种基于块 (即内存中连续神经元组) 的 I/O 高效稀疏化策略,将神经元重要性与存储访问成本耦合。该方法通过对访问连续性的轻量抽象建模 I/O 延迟,并选择具有高效用的块,即神经元重要性归一化后估计的延迟。通过将稀疏化决策与底层存储行为对齐,Neuron Chunking 在 Jetson Orin Nano 和 Jetson AGX Orin 上分别将 I/O 效率提高最高可达 4.65 倍和 5.76 倍。

关键词

引用

@article{arxiv.2511.18692,
  title  = {VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking},
  author = {Kichang Yang and Seonjun Kim and Minjae Kim and Nairan Zhang and Chi Zhang and Youngki Lee},
  journal= {arXiv preprint arXiv:2511.18692},
  year   = {2025}
}