中文

Video-LMM 后训练:深度解析视频推理中的大型多模态模型

计算机视觉与模式识别 2025-11-26 v6

摘要

视频理解代表了计算机视觉中最具挑战性的前沿,需要模型推断复杂的时空关系、长期依赖和多模态证据。最近涌现出的 Video-Large Multimodal Models (Video-LMMs),将视觉编码器与强大的基于解码器的语言模型集成,已在视频理解任务中展现出惊人的能力。然而,将这些模型从基本感知系统转化为具有 Sophisticated reasoning 能力的关键阶段——后训练——在文献中仍然碎片化。本综述提供了 Video-LMMs 后训练方法的首个全面检视,涵盖三个基本支柱:基于链律的监督微调(SFT)、来自可验证目标的强化学习(RL),以及通过增强推理计算的测试时扩展(TTS)。我们提出了结构化的分类法,阐明了这些技术的角色、相互关联和视频特定的适应,解决独特挑战,如时序局部化、时空 grounding、长视频效率和多模态证据集成。通过对代表性方法的系统分析,我们综合了关键设计原则、见解和评估协议,同时识别了奖励设计、可扩展性和 cost-performance 优化中的关键开放挑战。我们进一步精选了必需的基准、数据集和指标,以促进后训练效果的严格评估。本综述旨在为研究人员和实践者提供统一框架,以推动 Video-LMM 能力的发展。额外资源和更新请访问:https://github.com/yunlong10/Awesome-Video-LMM-Post-Training

关键词

引用

@article{arxiv.2510.05034,
  title  = {Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models},
  author = {Yolo Y. Tang and Jing Bi and Pinxin Liu and Zhenyu Pan and Zhangyun Tan and Qianxiang Shen and Jiani Liu and Hang Hua and Junjia Guo and Yunzhong Xiao and Chao Huang and Zhiyuan Wang and Susan Liang and Xinyi Liu and Yizhi Song and Junhua Huang and Jia-Xing Zhong and Bozheng Li and Daiqing Qi and Ziyun Zeng and Ali Vosoughi and Luchuan Song and Zeliang Zhang and Daiki Shimada and Han Liu and Jiebo Luo and Chenliang Xu},
  journal= {arXiv preprint arXiv:2510.05034},
  year   = {2025}
}

备注

Version v1.1