超越感知捷径:基于因果启发的轻量多模态大语言模型通用视频推理去偏优化
计算机视觉与模式识别
2026-05-06 v2
摘要
尽管强化学习 (RL) 在大型多模态语言模型 (MLLM) 中显著提升了推理能力,但其在边缘部署中必需的轻量模型方面的效果仍受限。为此,我们利用因果分析与实验揭示了感知偏差的底层现象,表明 RL 基于的微调迫使轻量模型优先采纳由数据偏差引发的感知捷径,而非发展出真正的推理能力。ederated by this insight, 我们提出了 VideoThinker—a 由因果启发构成的框架,通过两阶段去偏过程培育轻量模型中稳健的推理能力。首先,偏差感知训练阶段为构建专门的“偏差模型”,以体现这些捷径行为。随后,Causal Debiasing Policy Optimization (CDPO) 算法对主模型进行微调,采用创新的排斥目标,主动将其从偏差模型的错误逻辑中推开,同时拉近其与正确、可泛化解决方案之间的距离。我们的模型 VideoThinker-R1 在视频推理效率方面建立了新的状态-of-the-art。对于同规模比较,无需监督微调 (SFT) 且仅使用 1/训练数据的 RL,显著优于 VideoRFT-3B,在广泛使用的基准测试上取得 3.2% 的平均提升,并在 VideoMME 上领先 7%。对于跨规模比较,在多个基准测试中均超越更大的 Video-UTR-7B 模型,包括在MVBench 上获得 2.1% 的提升,在TempCompass 上获得 3.8% 的提升。代码已公开于 https://github.com/falonss703/VideoThinker。
引用
@article{arxiv.2605.01324,
title = {Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs},
author = {Jingze Wu and Quan Zhang and Hongfei Suo and Zeqiang Cai and Hongbo Chen},
journal= {arXiv preprint arXiv:2605.01324},
year = {2026}
}
备注
CVPR 2026 Poster