中文

重新审视视觉问答中的贪心解码:一种校准视角

计算与语言 2026-04-28 v1

摘要

随机采样策略在大型语言模型 (LLMs) 中广泛采用,用于平衡输出的连贯性和多样性。这些启发式方法通常被继承到多模态 LLMs (MLLMs) 中,而无需针对特定任务的正当性论证。然而,我们认为随机解码在视觉问答 (VQA) 中可能次优。VQA 是一个闭合任务,具有 head-heavy answer 分布,其中不确定性通常是 epistemic 的,源于缺失或模糊的视觉证据而非合理的连续性。本文从模型校准与预测准确性之间的关系提供了理论形式化,推导出贪心解码最优性的充分条件。大量实验提供了贪心解码优于随机采样的实证证据,适用于多个基准。此外,我们提出了用于推理模型的贪心解码,该方法在多模态推理场景中超越了随机采样和标准贪心解码。总体而言,我们的结果警示不要轻易沿用 LLMs 解码启发式方法于 MLLMs,并表明贪心解码可以是一个高效而强大的 VQA 默认选项。

关键词

引用

@article{arxiv.2604.23443,
  title  = {Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective},
  author = {Boqi Chen and Xudong Liu and Yunke Ao and Jianing Qiu},
  journal= {arXiv preprint arXiv:2604.23443},
  year   = {2026}
}