TinyLLaVA-Video-R1: 面向小型多模态模型的视频推理
计算机视觉与模式识别
2025-04-15 v1
摘要
最近,通过强化学习提高大型多模态模型 (LMM) 推理能力取得了大大发展。然而,大多数现有工作基于数学和代码等高度推理密集型数据集,研究人员通常选择大规模模型作为基础。我们认为,探索小规模模型的推理能力仍然具有价值,这对于计算资源有限的研究人员而言。此外,使模型在 general question-answering 数据集上解释其推理过程同样重要。因此,我们提出了小规模视频推理模型 TinyLLaVA-Video-R1。基于参数不足 4B 的 TinyLLaVA-Video,这是一个经过 traceably 训练的 video understanding 模型,它不仅在 general Video-QA 数据集上使用强化学习后显示出显著的推理和思考能力,还表现出 "aha 时刻" 的 emergent 特征。此外,我们分享了一系列实验发现,旨在为未来探索 video reasoning (thinking) 在小规模模型中的能力提供 practical insight。它可在 https://github.com/ZhangXJ199/TinyLLaVA-Video-R1 访问。
引用
@article{arxiv.2504.09641,
title = {TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning},
author = {Xingjian Zhang and Siwei Wen and Wenjun Wu and Lei Huang},
journal= {arXiv preprint arXiv:2504.09641},
year = {2025}
}