中文

边缘视觉语言模型的极端模型压缩:稀疏时间标记融合与自适应神经压缩

计算机视觉与模式识别 2025-11-25 v1

摘要

边缘AI在视觉语言任务中对在资源受限设备上实现实时性能提出了要求,这些设备在功耗和内存方面受到限制。本文提出两种自适应压缩技术——稀疏时间标记融合(Sparse Temporal Token Fusion, STTF)和自适应神经压缩(Adaptive Neural Compression, ANC)——将算法创新与硬件感知优化相结合。不同于依赖静态剪枝或均匀缩放的先前方法,STTF通过基于事件驱动的变更检测动态重用视觉标记,而ANC通过学习路由器条件激活编码器分支,实现对场景复杂度的细粒度适应。我们的3B参数TinyGPT-STTF在COCO 2017测试集上取得CIDEr 131.2、BLEU-4 0.38、METEOR 0.31和ROUGE-L 0.56,凭借2.3倍的参数和62倍的设备FLOPs,超过LLaVA-1.5 7B模型提升了17.6个CIDEr分数。TinyGPT-ANC达到CIDEr 128.5。在基于事件的视觉任务中,STTF将平均标记数减少84%(从196个降至31个),同时在DVS128 Gesture数据集上保持95.6%的准确率,ANC在低运动场景中将FLOPs降低最高可达90%。与强基线相比,我们的模型在准确率上提升最高可达4.4%,延迟降低最高可达13倍。这些结果使能够在实际边缘设备上部署的高性能视觉语言模型成为可能。

关键词

引用

@article{arxiv.2511.18504,
  title  = {Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression},
  author = {Md Tasnin Tanvir and Soumitra Das and Sk Md Abidar Rahaman and Ali Shiri Sichani},
  journal= {arXiv preprint arXiv:2511.18504},
  year   = {2025}
}

备注

9 pages, 6 figures