中文

Atom:通过模块化复用实现高效的端侧视频语言流水线

机器学习 2025-12-22 v1 多媒体

摘要

视频语言模型的最新进展使视频检索、字幕生成和组装等强大应用成为可能。然而,由于冗余的模型加载和碎片化的执行,在移动设备上高效执行此类多阶段流水线仍具有挑战性。我们提出了Atom,一个端侧系统,用于重构视频语言流水线以实现快速高效执行。Atom将十亿参数模型分解为可复用模块,如视觉编码器和语言解码器,并在字幕生成、推理和索引等子任务中复用它们。这种以复用为中心的设计消除了重复的模型加载并支持并行执行,在不牺牲性能的情况下降低了端到端延迟。在商用智能手机上,Atom相比非复用基线实现了27--33%的加速执行,性能仅略有下降(检索中Recall@1降低≤2.3,字幕生成中CIDEr降低≤1.5)。这些结果使Atom成为端侧设备上高效视频语言理解的一种实用、可扩展的方法。

关键词

引用

@article{arxiv.2512.17108,
  title  = {Atom: Efficient On-Device Video-Language Pipelines Through Modular Reuse},
  author = {Kunjal Panchal and Saayan Mitra and Somdeb Sarkhel and Haoliang Wang and Ishita Dasgupta and Gang Wu and Hui Guan},
  journal= {arXiv preprint arXiv:2512.17108},
  year   = {2025}
}