解耦感知与推理以提高视频理解中的幻觉抗性
计算机视觉与模式识别
2026-03-13 v3
摘要
视频大语言模型通过生成中间推理文本来提高对复杂视频的推理能力。然而,可靠的推理依赖于准确的视频感知。在现有方法中,感知证据与推理文本交织在一起,使得直接监督感知过程变得困难。我们认为,可靠的监督需要显式地将感知证据从推理中解耦,以便独立验证感知。为直接监督感知,我们提出了解耦感知与逻辑 (Decoupled Perception and Logic, DPL) 方法,将感知表示为包含时间戳和视觉描述的固定格式证据单元。这种结构化表示使我们能够直接提取感知内容,并简化视频片段与奖励评估之间的对齐。在 DPL 基础上,我们引入了感知奖励,以鼓励幻觉抗性和基于感知的推理。事实导向评估器 (Factual-Aware Evaluator, FAE) 提供反幻觉评分,实现的幻觉评估性能与 GPT-4o 相当。此外,我们通过将感知结果和问题输入参考模型来验证推理一致性。实验表明,通过提供可靠的过程奖励,Video-DPL 在 3B 和 7B 规模下均能显著提升微调后的性能,同时实现更高的数据效率。
引用
@article{arxiv.2511.18463,
title = {Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding},
author = {Bowei Pu and Chuanbin Liu and Yifan Ge and Peicheng Zhou and Yiwei Sun and Zhiying Lu and Zhangchi Hu and Hongtao Xie},
journal= {arXiv preprint arXiv:2511.18463},
year = {2026}
}
备注
17 pages, 8 figures