中文

释放感知时间尺度扩展至多模态推理模型

计算机视觉与模式识别 2025-10-13 v1 计算与语言

摘要

推理时间尺度扩展(inference-time scaling)的最新进展,尤其是利用带可验证奖励的强化学习,已显著增强了大视觉-语言模型(LVLMs)的推理能力。受此成功启发,类似策略已被应用于多模态推理,但其对视觉感知的影响仍不清楚。为探究这一空白,我们引入了 DisTANCE——一个面向视觉估计任务的以感知为中心的基准。评估结果显示,LVLMs 的估计精度有限,推理时间尺度扩展仅带来边际增益。我们将此归因于当前 LVLMs 的快速感知范式——视觉理解被视为一次性输出,而未建模其底层感知过程。为此,我们提出感知时间尺度扩展(Perception-Time Scaling, PTS),一种新颖的范式,鼓励富含 token 的感知,并将复杂感知问题分解为中间可处理的子问题,从而使感知能够与推理时间尺度扩展对齐并从中受益。结合强化学习技术,PTS 显著提升了感知精度,将 DisTANCE 上的高精度性能从 8.0% 提升至 64.7%,并能良好泛化至分布外任务。令人惊讶的是,尽管 PTS 数据完全合成的,将其与数学推理数据结合,仍能在推理与真实世界感知基准上带来一致增益。进一步分析表明,PTS 引入了更多与感知相关的 token,并增强了模型对图像 token 的注意力。我们的代码与数据将公开发布。

关键词

引用

@article{arxiv.2510.08964,
  title  = {Unleashing Perception-Time Scaling to Multimodal Reasoning Models},
  author = {Yifan Li and Zhenghao Chen and Ziheng Wu and Kun Zhou and Ruipu Luo and Can Zhang and Zhentao He and Yufei Zhan and Wayne Xin Zhao and Minghui Qiu},
  journal= {arXiv preprint arXiv:2510.08964},
  year   = {2025}
}