超文本视频理解的多模态内省推理
计算机视觉与模式识别
2026-05-15 v3
摘要
依赖纯文本重思考的自我反思机制在大多数多模态任务中表现良好。然而,当直接应用于长文本视频理解场景时,他们会显露明显局限性。其根本原因在于两个方面:(1)长文本视频理解涉及更丰富且更动态的视觉输入,仅重思考文本信息不够,必须针对视觉信息进行进一步的重思考过程;(2)纯文本反思机制缺乏跨模态交互能力,阻碍其在反思过程中充分整合视觉信息。鉴于这些见解,我们提出 REVISOR(REflective VIsual Segment Oriented Reasoning),一种面向工具增强型多模态反思的新框架。REVISOR 使 MLLMs 能够在文本和视觉模态之间协作构建内省反思过程,显著提升其处理长文本视频理解的推理能力。为确保 REVISOR 能在强化学习期间学习准确审查与问题高度相关的视频片段,我们设计了 Dual Attribution Decoupled Reward(DADR)机制。该机制集成到 GRPO 训练策略中,强制模型的推理与所选视频证据之间存在因果一致性。值得注意的是,REVISOR 框架无需额外监督微调或外部模型,即可显著提升 MLLMs 在 VideoMME、LongVideoBench、MLVU 和 LVBench 等四个基准上的长文本视频理解能力。
引用
@article{arxiv.2511.13026,
title = {REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding},
author = {Jiaze Li and Hao Yin and Wenhui Tan and Jingyang Chen and Boshen Xu and Yuxun Qu and Yijing Chen and Jianzhong Ju and Zhenbo Luo and Jian Luan},
journal= {arXiv preprint arXiv:2511.13026},
year = {2026}
}