中文

从模仿到直觉:开放实例视频分类的内在推理

计算机视觉与模式识别 2026-03-30 v3

摘要

传统视频分类模型作为有效的模仿者,在数据分布均匀的场景中表现突出。然而,现实应用常面临开放实例挑战,其中类内变异巨大且复杂,超出现有基准测试的范围。虽然传统视频编码模型难以适应这些多样化的分布,但视觉语言模型(VLM)具有更好的泛化能力,却未充分利用其为此类任务提供的推理能力(直觉)。本文通过一种内在推理框架弥合这一差距,将开放实例视频分类从模仿演进到直觉。我们的方法称为DeepIntuit,首先通过冷启动监督对齐初始化推理能力,随后利用Group Relative Policy Optimization (GRPO)通过强化学习来增强推理连贯性。关键的是,为将这种推理转化为准确的分类,DeepIntuit引入了直觉校准阶段。在该阶段中,训练一个分类器,基于经强化学习精炼后的VLM生成的内在推理痕迹,确保知识传递稳定且无分布不匹配。广泛的实验表明,对于开放实例视频分类,DeepIntuit显著受益于超越简单的特征模仿,走向内在推理。我们的项目地址为https://bwgzk-keke.github.io/DeepIntuit/。

关键词

引用

@article{arxiv.2603.10300,
  title  = {From Imitation to Intuition: Intrinsic Reasoning for Open-Instance Video Classification},
  author = {Ke Zhang and Xiangchen Zhao and Yunjie Tian and Jiayu Zheng and Vishal M. Patel and Di Fu},
  journal= {arXiv preprint arXiv:2603.10300},
  year   = {2026}
}

备注

18 pages, 7 figures