中文

视觉-语言推理中测试时扩展的局限与收益

机器学习 2025-12-15 v1

摘要

测试时扩展(TTS)已成为通过分配推理时的额外计算来提升大型语言模型(LLM)推理能力的强大范式,然而其在视觉-语言模型(VLM)等多模态系统中的应用仍未被充分探索。在本工作中,我们对应用于不同基准的开源和闭源 VLM 上的推理时推理方法进行了系统的实证研究。我们的结果揭示,虽然闭源模型始终从结构化推理和迭代自我精炼中受益,但开源 VLM 表现出不一致的行为:外部验证提供最可靠的收益,而迭代精炼往往会降低性能。我们进一步发现 TTS 的有效性依赖于数据集,在多步推理任务上产生明显改善,但在以感知为重点的基准上仅提供有限的收益。这些结果表明 TTS 并非通用解决方案,必须根据模型能力和任务特征进行定制,这为自适应 TTS 策略和多模态奖励模型的未来工作提供了动力。

关键词

引用

@article{arxiv.2512.11109,
  title  = {Limits and Gains of Test-Time Scaling in Vision-Language Reasoning},
  author = {Mohammadjavad Ahmadpour and Amirmahdi Meighani and Payam Taebi and Omid Ghahroodi and Amirmohammad Izadi and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2512.11109},
  year   = {2025}
}

备注

Mohammadjavad Ahmadpour and Amirmadhi Meighani contributed equally to this work