中文

从记号到光子:面向视觉语言模型的测试时物理提示

计算机视觉与模式识别 2026-02-02 v2

摘要

为将视觉语言模型(VLMs)的应用从网络图像扩展到传感器介导的物理环境中,我们提出了一种基于物理提示的多视角测试时适应(MVP)框架,将相机曝光三角形——ISO、快门速度和光圈——视为物理提示。在推理时,MVP 获取每个场景的物理视图库,选择基于源亲和得分的前k个传感器设置,评估每个保留的视图下的轻量级数字增强,筛选出低熵子集的增强视图,并使用零温度 softmax(即硬投票)聚合预测。这种选择后投票设计简单、校准友好,且无需梯度或模型修改。在 ImageNet-ES 和 ImageNet-ES-Diverse 上,MVP 在单次自动曝光捕获时,相较于仅数字的测试时适应, consistently 获得最高可达25.6个百分点的提升,相较于结合传统传感器控制和测试时适应的管道,额外获得最高3.4个百分点的提升。MVP 在降低捕获延迟的有限参数候选集下仍然有效,表明具有实际应用价值。这些结果支持了“超越捕获后提示,测量时控制——选择和组合真实物理视图——显著提高 VLMs 对鲁棒性”的主要论点。

关键词

引用

@article{arxiv.2512.12571,
  title  = {From Tokens to Photons: Test-Time Physical Prompting for Vision-Language Models},
  author = {Boyeong Im and Wooseok Lee and Yoojin Kwon and Hyung-Sin Kim},
  journal= {arXiv preprint arXiv:2512.12571},
  year   = {2026}
}