双阶段价值引导推理:基于边际的奖励调整实现快速而可靠的 VLM 描述生成
计算机视觉与模式识别
2025-06-19 v1 机器学习
摘要
尽管视觉语言模型(VLM)的推理时间搜索取得了显著进展,但现有方法仍昂贵且容易产生未被惩罚的低置信度生成,常导致持续的幻觉现象。我们提出价值引导推理与边际奖励调整(ViMaR),一种两阶段推理框架,通过结合时序差值模型和边际感知奖励来提升效率和输出忠实度。在第一个阶段,我们进行单次前向传播,以识别来自多样化候选描述中最高价值的标题。在第二个阶段,我们仅针对被忽视或视觉 grounding 较弱的片段进行精细化,从而消除频繁奖励评估。校准的边际惩罚机制抑制低置信度的延续,同时保持描述的丰富性。广泛的实验表明,ViMaR 在多个 VLM 架构上生成的描述显著更可靠、事实更准确、细节更丰富、解释更充分,同时实现了相较于现有价值引导方法的 4 倍以上加速。具体而言,我们证明 ViMaR 仅基于 LLaVA Mistral-7B 训练,即可有效地引导更强的不可见模型进行解码。为进一步验证,我们将 ViMaR 适用于 LLaVA-OneVision-Qwen2-7B, consistently 实现描述质量的提升,凸显 ViMaR 的跨模型灵活性和模块性,将其定位为可扩展且可迁移的推理时间解码策略。此外,当 ViMaR 生成的描述用于自训练时,底层模型在广泛的视觉理解基准上实现显著提升,凸显了快速、准确且自我改进的 VLM 流水线的潜力。
引用
@article{arxiv.2506.15649,
title = {Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning},
author = {Ankan Deria and Adinath Madhavrao Dukre and Feilong Tang and Sara Atito and Sudipta Roy and Muhammad Awais and Muhammad Haris Khan and Imran Razzak},
journal= {arXiv preprint arXiv:2506.15649},
year = {2025}
}