中文

通过层次差分蒸馏将视频语言模型扩展至 10K 帧

计算与语言 2025-09-11 v5 人工智能

摘要

长视频处理在视觉语言模型(VLMs)中因处理扩展时间序列的高计算成本而面临根本性挑战。现有的 token 剪枝和特征合并方法往往牺牲关键时序依赖或稀释语义信息。我们引入差分蒸馏,这是一种原则化的方法,系统性地保留任务相关信息的同时抑制冗余信息。在此基础上,我们开发了 ViLAMP,一种层次化视频语言模型,能够通过两种关键机制在“混合精度”下处理长达一小时的视频:(1)差分关键帧选择在帧级上最大化查询相关性同时保持时序差异性;(2)差分特征合并在补丁级上保留查询 salient 特征。因此,ViLAMP 在关键帧中保留完整信息,而在非关键帧中仅保留最关键的特征,类似于混合精度训练。广泛的实验表明,ViLAMP 在四个视频理解基准测试中表现优异,尤其在长内容方面表现突出。值得注意的是,ViLAMP 可在单张 NVIDIA A100 GPU 上处理最高达 10K 帧的超长视频,在保持最先进性能的同时实现显著的计算效率。代码和模型已公开于 https://github.com/steven-ccq/ViLAMP。

关键词

引用

@article{arxiv.2504.02438,
  title  = {Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation},
  author = {Chuanqi Cheng and Jian Guan and Wei Wu and Rui Yan},
  journal= {arXiv preprint arXiv:2504.02438},
  year   = {2025}
}

备注

Accepted by ICML 2025