小型视觉语言模型的高效测试时扩展
机器学习
2026-02-17 v2 计算机视觉与模式识别
摘要
小型视觉语言模型(Small Vision-Language Models, VLMs)作为大型模型的计算效率替代方案,却在泛化能力和下游任务性能方面存在不足。这些局限性可通过测试时扩展技术予以缓解,但现有方法通常计算开销巨大,与小型模型的资源效率设计目标相矛盾。为此,我们提出两种新颖且高效的测试时扩展策略,利用模型内部特征而非外部监督:(i)测试时增强(Test-Time Augmentation, TTAug),该方法生成多个增强输入并在不进行参数更新的情况下对输出在 token 级别进行聚合;(ii)测试时适应(Test-Time Adaptation, TTAdapt),该方法在推理过程中根据 TTAug 生成的共识式伪标签调整模型参数。通过九个基准的广泛实验,我们展示在保持计算效率适用于资源受限环境的同时,方法一致性地实现性能提升。我们的方法的通用性体现在不同规模模型以及不同 VLMs 无需额外调参即可应用。
引用
@article{arxiv.2510.03574,
title = {Efficient Test-Time Scaling for Small Vision-Language Models},
author = {Mehmet Onurcan Kaya and Desmond Elliott and Dim P. Papadopoulos},
journal= {arXiv preprint arXiv:2510.03574},
year = {2026}
}
备注
Accepted at ICLR 2026. Project Page: https://monurcan.github.io/efficient_test_time_scaling