中文

TinyLLaVA-Video-R1: 面向小型多模态模型的视频推理

计算机视觉与模式识别 2025-04-15 v1

摘要

最近,通过强化学习提高大型多模态模型 (LMM) 推理能力取得了大大发展。然而,大多数现有工作基于数学和代码等高度推理密集型数据集,研究人员通常选择大规模模型作为基础。我们认为,探索小规模模型的推理能力仍然具有价值,这对于计算资源有限的研究人员而言。此外,使模型在 general question-answering 数据集上解释其推理过程同样重要。因此,我们提出了小规模视频推理模型 TinyLLaVA-Video-R1。基于参数不足 4B 的 TinyLLaVA-Video,这是一个经过 traceably 训练的 video understanding 模型,它不仅在 general Video-QA 数据集上使用强化学习后显示出显著的推理和思考能力,还表现出 "aha 时刻" 的 emergent 特征。此外,我们分享了一系列实验发现,旨在为未来探索 video reasoning (thinking) 在小规模模型中的能力提供 practical insight。它可在 https://github.com/ZhangXJ199/TinyLLaVA-Video-R1 访问。

关键词

引用

@article{arxiv.2504.09641,
  title  = {TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning},
  author = {Xingjian Zhang and Siwei Wen and Wenjun Wu and Lei Huang},
  journal= {arXiv preprint arXiv:2504.09641},
  year   = {2025}
}