中文

面向视觉语言模型的联邦提示学习实证研究

机器学习 2025-09-19 v2

摘要

视觉语言模型(VLM)擅长对齐视觉与语言表示,而提示学习已成为使此类模型适应下游任务的关键技术。然而,在联邦学习(FL)场景下将提示学习应用于 VLM 仍未得到充分探索。本文系统研究了在标签偏斜和领域偏移等数据异质性挑战下,语言提示学习(LPT)与视觉提示学习(VPT)之间的行为差异。我们进行了广泛的实验,以评估各种 FL 和提示配置(如客户端规模、聚合策略和提示长度)的影响,从而衡量联邦提示学习(FPL)的鲁棒性。此外,我们探索了在标签偏斜与领域偏移共存的复杂场景下增强提示学习的策略,包括在计算资源允许时同时利用两种提示类型。我们的发现为在联邦环境中优化提示学习提供了实践见解,有助于推动 VLM 在隐私保护环境中的更广泛部署。

关键词

引用

@article{arxiv.2505.23024,
  title  = {An Empirical Study of Federated Prompt Learning for Vision Language Model},
  author = {Zhihao Wang and Wenke Huang and Tian Chen and Zekun Shi and Guancheng Wan and Yu Qiao and Bin Yang and Jian Wang and Bing Li and Mang Ye},
  journal= {arXiv preprint arXiv:2505.23024},
  year   = {2025}
}