FLoRA: 通过参数高效联邦学习增强视觉语言模型
机器学习
2024-04-24 v1 人工智能
摘要
在人工智能快速发展的领域中,多模态模型(例如将视觉和语言整合到视觉语言模型(VLM)中)已成为许多应用的关键,从图像描述到多模态搜索引擎。在这些模型中,对比语言-图像预训练(CLIP)模型在理解和生成文本与图像之间的细微关系方面表现出色。然而,这类模型的传统训练通常需要集中聚合大量数据集,带来了显著的隐私和数据治理挑战。为了解决这些问题,本文提出了一种新颖的方法,利用联邦学习和参数高效适配器(即低秩适配(LoRA))来训练VLM。该方法通过在分散的数据源上训练模型来保护数据隐私,并通过LoRA的参数高效微调确保模型适应性和效率。我们的方法将训练时间加速了高达34.72倍,并且内存使用量比全微调减少了2.47倍。
引用
@article{arxiv.2404.15182,
title = {FLoRA: Enhancing Vision-Language Models with Parameter-Efficient Federated Learning},
author = {Duy Phuong Nguyen and J. Pablo Munoz and Ali Jannesari},
journal= {arXiv preprint arXiv:2404.15182},
year = {2024}
}
备注
10 pages, 11 figures