基于原型的提示估计用于视觉Transformer的联邦提示调优
计算机视觉与模式识别
2026-05-12 v2 机器学习
摘要
视觉提示调优(VPT)是对预训练的视觉Transformer(ViT)的一种有效的参数高效微调技术,适用于数据有限的下游任务。其参数效率使其特别适用于联邦学习(FL),因为通信和计算预算常常受限。然而,全局提示调优在异构客户端之间难以泛化,而个性化调优则会过度拟合本地数据且缺乏泛化性。我们提出了PEP-FedPT(Prompt Estimation from Prototypes for Federated Prompt Tuning),一个统一的框架,旨在实现联邦提示调优中既有泛化性又有个性化。我们引入了 novel Class-Contextualized Mixed Prompt(CCMP),即基于类的上下文混合提示——在全球共享提示之外,维护一组基于类的特定提示。对于每个输入,CCMP根据全局类原型和客户端类先验自适应地组合类特定提示。这一方法实现了无需存储客户端相关可训练参数的逐样本提示个性化。通过在同一数据集上进行传统联邦平均优化。我们在CIFAR-100、TinyImageNet、DomainNet和iNaturalist数据集上进行了全面评估,表明PEP-FedPT在各种数据异构性场景下均优于最先进的基线,为Vision Transformer的高效和通用联邦提示调优奠定了坚实基础。
关键词
引用
@article{arxiv.2510.25372,
title = {Prompt Estimation from Prototypes for Federated Prompt Tuning of Vision Transformers},
author = {M Yashwanth and Sharannya Ghosh and Aditay Tripathi and Anirban Chakraborty},
journal= {arXiv preprint arXiv:2510.25372},
year = {2026}
}
备注
Accepted to TMLR 2026