Xiaoice:通过自监督时空聚类实现无训练视频理解
摘要
大规模视觉语言模型(VLM)在静态图像上的零样推理能力尚未充分转化到视频领域。常规视频理解模型通常依赖于在标注数据集上进行大量任务特定训练,过程代价高昂且受限于可扩展性。本文提出一种新颖的、无需训练的视频理解框架,通过融合预训练 VLM 的丰富语义先验与经典机器学习算法进行模式发现,规避了端到端训练。我们的核心思想是将视频理解重新表述为高维语义特征空间中的自监督时空聚类问题。该方法的管道首先将视频流转换为语义特征轨迹,使用预训练 VLM 的冻结视觉编码器。随后,我们采用核时序分段(KTS)等稳健机器学习技术,将连续特征流划分为离散且语义连贯的事件段。这些片段随后受到基于密度的聚类,以识别视频中反复出现的宏观场景和主题。通过从每个发现的聚类中选择代表性关键帧,并利用 VLM 的生成能力进行文本描述,我们的框架自动产生视频内容的结构化、多模态摘要。该方法为零样例、自动化的视频内容结构分析提供了有效、可解释且与模型无关的途径。
引用
@article{arxiv.2510.16781,
title = {Xiaoice: Training-Free Video Understanding via Self-Supervised Spatio-Temporal Clustering of Semantic Features},
author = {Shihao Ji and Zihui Song},
journal= {arXiv preprint arXiv:2510.16781},
year = {2025}
}
备注
This paper is being withdrawn because we have identified a significant error in the implementation of our self-supervised clustering approach. Specifically, our feature aggregation step inadvertently leaked temporal information across frames, which violates the core assumption of our training-free method. We sincerely apologize to the research community