强化结构化思维链以实现视频理解
计算机视觉与模式识别
2026-03-30 v1 人工智能
摘要
多模态大语言模型(MLLM)在视频理解中展现出前景。然而,其推理常受思维漂移和弱时间理解能力的困扰,即使借助强化学习(RL)技术如Group Relative Policy Optimization (GRPO)加以增强。此外,现有的RL方法通常依赖于监督微调(SFT),这需要昂贵的思维链(CoT)标注和多阶段训练,并强制固定的推理路径,限制了MLLM的泛化能力并可能引入偏差。为克服这些限制,我们提出了Summary-Driven Reinforcement Learning (SDRL),一种新型单阶段RL框架,通过利用结构化CoT格式——总结(Summarize)->思考(Think)->回答(Answer)——消除了对SFT的需求。SDRL在GRPO目标中引入了两种自监督机制:1)视觉知识一致性(CVK)通过减少生成摘要之间的KL散度来强制事实基础;2)推理动态多样性(DVR)通过基于组准确率动态调节思维多样性来促进探索。这种新颖的整合有效平衡了对齐与探索,同时监督最终答案和推理过程。我们的方法在七个公开VideoQA数据集上取得了最先进性能。
引用
@article{arxiv.2603.25942,
title = {Reinforcing Structured Chain-of-Thought for Video Understanding},
author = {Peiyao Wang and Haotian Xu and Noranart Vesdapunt and Rui Hou and Jingyi Zhang and Haibin Ling and Oleksandr Obiednikov and Ning Zhou and Kah Kuen Fu},
journal= {arXiv preprint arXiv:2603.25942},
year = {2026}
}
备注
Accepted to CVPR 2026 (Main Conference)