中文

感知流网络:用于视觉 grounding 推理

计算机视觉与模式识别 2026-05-05 v1 人工智能

摘要

尽管大型视觉语言模型(LVLMs)取得了成功,但通用优化目标(如标准最大似然估计)难以约束视觉轨迹,导致语言偏见和幻觉。为缓解此问题,当前方法引入来自视觉专家的几何先验作为额外监督。然而,我们注意到这种监督通常并非最佳:它偏向几何精度且提供有限的推理效用。为填补这一差距,我们提出感知流网络(PFlowNet),它摒弃对专家先验的刚性对齐,实现可解释且更有效的视觉推理。具体而言,PFlowNet 将感知与推理解耦,以建立自条件生成过程。基于此,它整合多维奖励通过变分强化学习实现 vicinal 几何塑造,从而促进以推理为导向的感知行为同时保持视觉可靠性。PFlowNet 提供可证明的性能保证并实现竞争性实证结果,尤其在 V* Bench(90.6%)和 MME-RealWorld-lite(67.0%)上取得了新的 SOTA 记录。

关键词

引用

@article{arxiv.2605.02730,
  title  = {Perceptual Flow Network for Visually Grounded Reasoning},
  author = {Yangfu Li and Yuning Gong and Hongjian Zhan and Teng Li and Yuanhuiyi Lyu and Tianyi Chen and Qi Liu and Ziyuan Huang and Zhihang Zhong and Dandan Zheng and Yue Lu},
  journal= {arXiv preprint arXiv:2605.02730},
  year   = {2026}
}

备注

36 pages with 17 figures, Accepted at ICML 2026