Just Shift It:基于视觉语言模型的测试时原型平移实现零样子类泛化
计算机视觉与模式识别
2024-12-12 v2 人工智能
机器学习
摘要
视觉语言模型 (VLM) 的快速发展推动了计算机视觉领域,尤其是在零样子类学习场景中。尽管具备前景,但这些模型常因测试环境中的域迁移而效果下降。为此,我们提出Test-Time Prototype Shifting (TPS)框架,首次实现基于无标签测试输入的VLM适应。该方法基于调制共享嵌入空间中各类的原型思维。通过预计算并缓存使用预训练文本编码器生成的原型,TPS不仅便于后续预测的无优化原型重用,还能无缝集成当前prompt engineering的最新进展。在测试时,TPS仅基于给定测试样本动态学习各原型的平移向量,从而有效弥合域间差距,提升分类准确率。该框架的一个显著特点是相较于传统文本提示调谈方法,在内存和计算需求上显著降低。通过在15个图像分类数据集上进行大量评估,涵盖自然分布迁移和跨数据集泛化,以及情境依赖的视觉推理,结果表明TPS在保持资源效率的同时实现了领先性能。
引用
@article{arxiv.2403.12952,
title = {Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models},
author = {Elaine Sui and Xiaohan Wang and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2403.12952},
year = {2024}
}
备注
Accepted at WACV 2025