中文

VideoPerceiver: 提升视频多模态大语言模型中细粒度时序感知能力

计算机视觉与模式识别 2025-11-25 v1

摘要

我们提出 VideoPerceiver,一种新型视频多模态大语言模型 (VMLLM),以增强视频理解中对短时动作或长视频中稀有瞬时事件的推理能力。VideoPerceiver 采用两阶段训练框架。在监督微调 (SFT) 阶段,我们通过从描述中提取事件-动作关键词、识别相应关键帧并替换为相邻帧,构建“关键信息缺失”视频。我们联合编码原始和修改后的视频 token 与文本 token,通过基于对比损失将中间视觉表征与关键词对齐,以增强对细粒度运动线索的敏感性。在强化学习 (RL) 阶段,两种视频变体输入模型生成描述, novel relative reward 确保完整视频的响应优于退化输入,显式训练模型恢复时序精确的动作细节。我们还策划了包含 8 万个具有细粒度动作和瞬时事件的视频数据集。实验表明,VideoPerceiver 在细粒度动作理解和稀有事件描述基准中显著优于最先进的 VMLLM,同时保持对标准任务的强性能力。通过优先处理任务相关视觉特征,我们的工作重新定义了面向细粒度感知的视频语言模型训练。

关键词

引用

@article{arxiv.2511.18823,
  title  = {VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models},
  author = {Fufangchen Zhao and Liao Zhang and Daiqi Shi and Yuanjun Gao and Chen Ye and Yang Cai and Jian Gao and Danfeng Yan},
  journal= {arXiv preprint arXiv:2511.18823},
  year   = {2025}
}