通过无数据平坦感知提示预训练改进视觉-语言模型测试时提示调优的校准
计算机视觉与模式识别
2026-05-01 v1
摘要
测试时提示调优(TPT)已成为一种有前景的技术,通过使用无标签测试数据优化文本提示来增强视觉-语言模型的适应性。然而,先前的研究观察到TPT通常会产生校准不佳的模型,引发了对其预测可靠性的担忧。近期的工作通过引入约束模型输出的额外正则化项来解决此问题,这改善了校准但常常降低了性能。在这项工作中,我们揭示了这些正则化策略隐式地鼓励优化朝向更平坦的极小值,并且适应后提示周围损失景观的尖锐度是决定校准质量的关键因素。受此观察启发,我们引入了平坦感知提示预训练(FPP),这是一个简单而有效的TPT预训练框架,它在适应之前将提示初始化于损失景观的较平坦区域。我们表明,简单地替换现有TPT流程中的初始化——无需修改任何其他组件——就足以改善校准和性能。值得注意的是,FPP不需要任何有标签数据,并且在测试时调优期间不产生额外的计算成本,使其在实际部署中非常实用。代码可在以下地址获取:https://github.com/YonseiML/fpp。
引用
@article{arxiv.2604.27715,
title = {Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining},
author = {Hyeonseo Jang and Jaebyeong Jeon and Joong-Won Hwang and Kibok Lee},
journal= {arXiv preprint arXiv:2604.27715},
year = {2026}
}
备注
CVPR 2026