从模仿到直觉:开放实例视频分类的内在推理
计算机视觉与模式识别
2026-03-30 v3
摘要
传统视频分类模型作为有效的模仿者,在数据分布均匀的场景中表现突出。然而,现实应用常面临开放实例挑战,其中类内变异巨大且复杂,超出现有基准测试的范围。虽然传统视频编码模型难以适应这些多样化的分布,但视觉语言模型(VLM)具有更好的泛化能力,却未充分利用其为此类任务提供的推理能力(直觉)。本文通过一种内在推理框架弥合这一差距,将开放实例视频分类从模仿演进到直觉。我们的方法称为DeepIntuit,首先通过冷启动监督对齐初始化推理能力,随后利用Group Relative Policy Optimization (GRPO)通过强化学习来增强推理连贯性。关键的是,为将这种推理转化为准确的分类,DeepIntuit引入了直觉校准阶段。在该阶段中,训练一个分类器,基于经强化学习精炼后的VLM生成的内在推理痕迹,确保知识传递稳定且无分布不匹配。广泛的实验表明,对于开放实例视频分类,DeepIntuit显著受益于超越简单的特征模仿,走向内在推理。我们的项目地址为https://bwgzk-keke.github.io/DeepIntuit/。
引用
@article{arxiv.2603.10300,
title = {From Imitation to Intuition: Intrinsic Reasoning for Open-Instance Video Classification},
author = {Ke Zhang and Xiangchen Zhao and Yunjie Tian and Jiayu Zheng and Vishal M. Patel and Di Fu},
journal= {arXiv preprint arXiv:2603.10300},
year = {2026}
}
备注
18 pages, 7 figures