面向流式视频理解的 VideoScaffold:弹性规模视觉层次结构
计算机视觉与模式识别
2025-12-30 v1 人工智能
计算与语言
机器学习
摘要
理解长时长视频面临两个主要挑战:跨帧的大量冗余,以及需要保持时间上的连贯表征。现有的静态策略——如稀疏抽样、帧压缩和聚类——针对离线场景优化,常在应用于连续视频流时产生碎片化或过度压缩的结果。我们提出 VideoScaffold,一个为流式视频理解设计的动态表示框架。它根据视频时长自适应调整事件粒度,同时保留细粒度的视觉语义。VideoScaffold 包含两个关键组件:弹性规模事件分段(EES),通过预测引导的分段实现动态细化事件边界;以及层次化事件合并(HEC),逐步聚合语义相关的片段至多层抽象。EES 与 HEC 协同工作,使 VideoScaffold 能在视频流经过程中从细粒度帧理解平滑过渡到抽象事件推理。广泛的实验在离线和流式视频理解基准测试上表明,VideoScaffold 实现了最先进的性能。该框架模块化且即插即用,无缝扩展现有的基于图像的多模态大语言模型至连续视频理解。代码已公开于 https://github.com/zheng980629/VideoScaffold。
引用
@article{arxiv.2512.22226,
title = {VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs},
author = {Naishan Zheng and Jie Huang and Qingpei Guo and Feng Zhao},
journal= {arXiv preprint arXiv:2512.22226},
year = {2025}
}
备注
11 pages, 4 figures