中文

零样本视频理解的动态标记合并

计算机视觉与模式识别 2025-03-25 v2 机器学习

摘要

最近的多模态大语言模型(MLLM)的进展为视频理解开辟了新途径。然而,在零样本视频任务中实现高保真仍具有挑战性。传统视频处理方法高度依赖微调以捕捉细微的时空细节,这会带来显著的数据和计算成本。相比之下,训练无关方法虽高效,却在保留复杂视频内容中富有语境的特征方面往往缺乏鲁棒性。为此,我们提出 DYTO,一种用于零样本视频理解的动态 token 合并框架,通过自适应优化 token 效率同时保留关键场景细节来实现这一目标。DYTO 集成了分层帧选择和二分 token 合并策略,以动态聚类关键帧并有选择地压缩 token 序列,在计算效率与语义丰富性之间取得平衡。广泛的实验表明 DYTO 的有效性,在多个基准测试中实现优于现有微调和训练无关方法的卓越性能,为零样本视频理解设立了新的 SOTA。

关键词

引用

@article{arxiv.2411.14401,
  title  = {Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding},
  author = {Yiming Zhang and Zhuokai Zhao and Zhaorun Chen and Zenghui Ding and Xianjun Yang and Yining Sun},
  journal= {arXiv preprint arXiv:2411.14401},
  year   = {2025}
}

备注

Code is available at https://github.com/Jam1ezhang/DYTO