中文

面向视频摘要的 VLMs 早期退出与多阶段知识蒸馏

计算机视觉与模式识别 2025-09-12 v2 人工智能

摘要

我们提出了 DEEVISum(Distilled Early Exit Vision language model for Summarization,即蒸馏早期退出视觉语言模型用于摘要生成),这是一种轻量、高效且可扩展的视觉语言模型,专为片段级视频摘要设计。通过结合文本和音频派生信号的多模态提示,DEEVISum 融合了多阶段知识蒸馏(MSKD)和早期退出(EE)技术,实现性能与效率之间的平衡。MSKD 相对于基线蒸馏(0.5%)提升了 1.33% 的绝对 F1 分数,而 EE 可将推理时间约降低 21%,仅有 1.3 分的 F1 分数下降。在 TVSum 数据集上进行评估,我们的最佳模型 PaLI Gemma2 3B + MSKD 达到了 61.1 的 F1 分数,性能与显著更大模型相当,同时保持更低的计算资源占用。我们公开代码和处理后的数据集,以支持进一步的研究。

关键词

引用

@article{arxiv.2504.21831,
  title  = {Early Exit and Multi Stage Knowledge Distillation in VLMs for Video Summarization},
  author = {Anas Anwarul Haq Khan and Utkarsh Verma and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2504.21831},
  year   = {2025}
}