中文

ReasonAct:面向小模型的细粒度视频推理渐进式训练

计算机视觉与模式识别 2025-11-27 v2

摘要

虽然最近的多模态模型在视觉语言任务上取得了进展,但小规模的模型仍然在视频理解所需的细粒度时序推理方面受限。我们提出 ReasonAct,通过三个阶段的训练过程来增强小模型的视频推理能力:首先通过文本-only 推理建立基础,随后在视频数据上微调,最后通过时序感知强化学习进行细化。在 Temporal Group Relative Policy Optimization (T-GRPO) 基础上,我们引入时序一致性建模以整合到策略优化中。我们还提出一种受生物力学启发的子动作分解机制,为各个动作阶段提供递增的奖励。通过在 HMDB51、UCF-101 和 Kinetics-400 上的实验,我们的 3B 参数模型分别实现了 67.2%、94.1% 和 78.9% 的准确率,分别比基线提高了 17.9、15.8 和 12.3 个百分点。消融实验表明,我们的渐进式训练使小模型能够在保持计算效率的同时,实现了具竞争力的视频推理性能。

关键词

引用

@article{arxiv.2508.01533,
  title  = {ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models},
  author = {Jiaxin Liu and Zhaolu Kang},
  journal= {arXiv preprint arXiv:2508.01533},
  year   = {2025}
}