中文

复制研究:面向视觉语言模型的联邦文本驱动提示生成

计算机视觉与模式识别 2026-02-24 v1 机器学习

摘要

视觉语言模型如 CLIP 已展示出惊人的零样能力,但其在联邦学习场景下的适应性面临显著挑战,尤其是对未见类别的泛化问题。原始 FedTPG 论文 \cite{Qiu2024} 通过引入文本驱动提示生成网络,动态创建基于类别名称的提示,从而实现联邦设置下对未见类别的更好跨类泛化。本文对 FedTPG 进行忠实的复制研究,在六个多样化视觉数据集上评估预训练模型:Caltech101、Oxford Flowers、FGVC Aircraft、Oxford Pets、Food-101 和 DTD。我们的评估结果在准确率上与原论文报告值相差不足 0.2%,在见到的(基座)类别上平均准确率为 74.58%,在未见(新)类别上为 76.00%,实现了 1.43 个百分点的泛化提升。这些结果验证了原论文的核心论点:(1) 文本驱动提示生成比静态提示学习方法实现更好的未见类别泛化;(2) 在不共享私有数据的前提下,对提示生成器的联邦训练可在多样化视觉领域内保持高性能。我们的成功复制确认了 FedTPG 方法的稳健性和可重复性。

关键词

引用

@article{arxiv.2602.18439,
  title  = {Replication Study: Federated Text-Driven Prompt Generation for Vision-Language Models},
  author = {Suraj Prasad and Anubha Pant},
  journal= {arXiv preprint arXiv:2602.18439},
  year   = {2026}
}

备注

6 pages, 2 figues