Pilot:构建联合多模态指令调优框架
机器学习
2025-01-27 v1 人工智能
计算机视觉与模式识别
摘要
本文探索了一种新颖的联合多模态指令调优任务(FedMIT),这对于在分布式设备上针对不同类型的多模态指令数据进行协作式微调具有重要意义。为解决这一新任务,本文提出了联合多模态指令调优框架(Pilot)。该框架将两种'adapter on adapter'集成到视觉编码器与LLM之间。第一阶段,从视觉信息中提取任务特定特征和客户端特定特征。第二阶段,构建跨任务混合式适配器(CT-MoA)模块以实现跨任务交互。每个客户端不仅能捕获本地数据的个人化信息并学习与任务相关的多模态信息,还能从其他任务中学习通用知识。此外,我们引入一种基于参数之间欧几里得距离计算权重的自适应参数聚合策略,用于文本训练参数,以最大限度地发挥积极影响,有效减少消极影响。该框架能够在指令调优过程中协作利用来自不同本地客户端的分布式数据,以学习跨任务知识,而不受任务异构性的影响。我们在两种不同的跨任务场景中验证了该方法的有效性。
引用
@article{arxiv.2501.13985,
title = {Pilot: Building the Federated Multimodal Instruction Tuning Framework},
author = {Baochen Xiong and Xiaoshan Yang and Yaguang Song and Yaowei Wang and Changsheng Xu},
journal= {arXiv preprint arXiv:2501.13985},
year = {2025}
}