中文

MetaTPT:面向视觉-语言模型的元学习测试时提示调优

计算机视觉与模式识别 2025-12-16 v1

摘要

视觉-语言模型(VLMs)如 CLIP 表现出强大的零样例泛化能力,但在测试时仍对域移移敏感。测试时提示调优(TPT)通过固定数据增广来适应提示,但在更具挑战性的情境下可能效果不佳。本文提出元学习测试时提示调优(MetaTPT),一种元学习框架,用于学习自监督辅助任务以指导测试时提示调优。该辅助任务动态学习每个样本的参数化数据增广,实现更具表达力的变换,捕捉目标域中的关键特征。MetaTPT 采用双循环优化范式:内循环学习自监督任务以生成信息性视图,而外循环通过在这些视图之间强制一致性来进行提示调优。通过将增广学习与提示调优耦合,MetaTPT 在域移移情况下实现了测试时适应的提升。大量实验表明,MetaTPT 在域泛化和跨数据集基准测试中实现了状态-of-the-art 性能。

关键词

引用

@article{arxiv.2512.12268,
  title  = {MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models},
  author = {Yuqing Lei and Yingjun Du and Yawen Huang and Xiantong Zhen and Ling Shao},
  journal= {arXiv preprint arXiv:2512.12268},
  year   = {2025}
}

备注

NeurIPS 2025 Workshop