面向视觉语言模型的平坦性引导测试时适应
计算机视觉与模式识别
2026-03-06 v2
摘要
视觉语言模型(VLM)的测试时适应(TTA)已成为应对测试时分布迁移的有效技术。近期研究表明,测试时适应本质上与模型的训练历史密切相关。然而,现有 TTA 方法如 Test-time Prompt Tuning 常在与模型训练特征脱节的情况下设计适应策略,从而降低性能。本文认为,通过锐度感知训练获得的平坦性是 VLMs 测试时适应的有效线索。基于此洞察,我们提出了一种新的平坦性引导适应框架(FGA),以统一训练与测试时的程序。其核心思想是利用训练最小值与测试损失平坦区域之间的对齐,引导适应过程。具体而言,我们的 FGA 包含一个调优阶段和一个测试时适应阶段。在调优阶段,利用锐度感知调优方法识别训练平坦最小值,为后续适应提供几何平坦性线索。在测试阶段,提出一种锐度测试样本选择方法,以确保训练平坦最小值与每个增强测试样本损失景观之间的对齐。与现有 TTA 方法相比,我们的 FGA 在测试时避免了昂贵的提示参数更新,大幅降低了计算开销。广泛的实验在域泛化和跨数据集基准测试中表明,我们的 FGA 在各种常见 TTA 方法中均表现出优异性能。特别是当采用 ViT-B/16 图像编码器时,FGA 在所有四个 ImageNet 不同域变体中均超过 TPT+CoOp 平均提升 4.88%。
引用
@article{arxiv.2501.18864,
title = {Flatness Guided Test-Time Adaptation for Vision-Language Models},
author = {Aodi Li and Liansheng Zhuang and Xiao Long and Houqiang Li and Shafei Wang},
journal= {arXiv preprint arXiv:2501.18864},
year = {2026}
}