中文

数据异质性下医学联邦视觉语言预训练的分布鲁棒对齐

机器学习 2024-11-25 v3 计算与语言 计算机视觉与模式识别

摘要

视觉语言预训练(VLP)已成为多模态表示学习的有效方案,但其对大规模多模态数据的依赖给医学应用带来了重大挑战。联邦学习(FL)提供了一种有前景的解决方案,可以在保护数据隐私的同时扩大医学VLP的数据集。然而,我们观察到现实场景中的客户端数据异质性可能导致模型在本地预训练期间学习有偏的跨模态对齐。这将限制联邦学习表示模型在下游任务上的可迁移性。为了解决这一挑战,我们提出了联邦分布鲁棒对齐(FedDRA),一个用于联邦VLP的框架,可在异质性条件下实现鲁棒的视觉语言对齐。基于客户端数据集,我们构建了一个包含潜在测试时域的分布族,并应用分布鲁棒框架来优化预训练模型在该分布空间上的性能。这种方法弥合了预训练样本与下游应用之间的差距。为了避免过拟合客户端特定信息,我们使用全局模型的锚点表示来指导本地训练,并采用两阶段方法先调整深层,然后更新整个网络。在真实世界数据集上的大量实验证明了FedDRA在数据异质性下增强医学联邦VLP的有效性。我们的方法也很好地适应了各种医学预训练方法。

关键词

引用

@article{arxiv.2404.03854,
  title  = {Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity},
  author = {Zitao Shuai and Chenwei Wu and Zhengxu Tang and Liyue Shen},
  journal= {arXiv preprint arXiv:2404.03854},
  year   = {2024}
}