基于同构 Transformer 模型的非配对多模态数据联邦学习
机器学习
2026-01-27 v1
摘要
多模态基础模型的训练目前局限于包含海量对齐数据集(如图文对)的集中式数据中心。然而,在现实的联邦环境中,数据通常是非配对的且分散在不相交的节点上;一个节点可能持有传感器数据,而另一个节点持有文本日志。这些数据集严格私有且无公共样本。当前的联邦学习(FL)方法在此场景下会失效,因为它们假设本地客户端拥有对齐的数据对,或要求共享原始特征嵌入,这违反了数据主权。我们提出了一种新框架,在具有不相交模态的去中心化节点上训练全局多模态 Transformer。我们引入了一个小型公共锚点集来对齐不相交的私有流形。利用从这些公共锚点计算的 Gram 矩阵,我们通过中心化核对齐在不传输私有样本的情况下实现跨模态的语义对齐,与原型共享相比,提供了数学上更优的隐私保证。此外,我们引入了一种子空间稳定的微调方法,以处理包含巨型 Transformer 模型的联邦学习。我们严格将特定领域的幅度偏移与语义方向解耦,确保具有不同传感器特性的节点在几何上对齐至全局共识。最后,我们提出了精度加权平均,利用高效获取的不确定性估计来降低不确定节点的权重。本文为联邦非配对基础模型建立了数学骨干,使全局模型能够从碎片化、不相交且私有的数据孤岛中学习世界的统一表示,而无需集中存储或配对样本。
引用
@article{arxiv.2601.17986,
title = {Federated learning for unpaired multimodal data through a homogeneous transformer model},
author = {Anders Eklund},
journal= {arXiv preprint arXiv:2601.17986},
year = {2026}
}