中文

基于步级视觉 grounding 的忠诚度预测了长期视觉语言模型的跨分布 generalizes

计算机视觉与模式识别 2026-03-10 v1 人工智能

摘要

我们揭示了长期视觉语言模型的一种行为规律:保持时序锚定信念的模型更易于泛化。标准基准仅衡量最终答案的准确率,这掩盖了模型如何使用视觉信息的过程;模型可以正确猜测,但其逐步推理完全未与视觉输入保持关联。我们将此正式化为长期尺度上的行为忠诚度,这是一种可经验测量的属性,量化模型中间推理是否与不断演化的视觉状态保持一致。我们在三个长期基准测试上的八个模型上进行实验,展示了时序 grounding 质量是鲁棒性的领先指标:步级 grounding 率 (SGR) 对跨分布保持率的预测值为 r=0.83r = 0.83 (置换检验 p=0.003p = 0.003),该关系在容量匹配的模型内部成立且不能由规模或分布内准确率解释。关键在于,尽管准确率相似,grounding 质量在参数匹配的 7B 模型间仍可差异达到 10.8 个百分点,这揭示了它是模型能力的独立轴。多重鲁棒性检查确认该信号反映真实的视觉依赖性:反事实轨迹使 SGR 下降 26--41 个百分点,跨架构验证器在 ρ=0.96\rho = 0.96 时达成一致,随机推理得分接近随机水平(约 18%),且即使无显式推理披露,预测器仍保持强大(r=0.78r = 0.78)。

关键词

引用

@article{arxiv.2603.06828,
  title  = {Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models},
  author = {Md Ashikur Rahman and Md Arifur Rahman and Niamul Hassan Samin and Abdullah Ibne Hanif Arean and Juena Ahmed Noshin},
  journal= {arXiv preprint arXiv:2603.06828},
  year   = {2026}
}