用于有限重叠垂直分区数据高效分类的实体增强
机器学习
2024-06-27 v1 计算机视觉与模式识别
分布式、并行与集群计算
摘要
垂直联邦学习(VFL)是一种机器学习范式,用于从垂直分区数据(即每个输入的特征分布在多个“客”客户端,而聚合的“主”服务器拥有标签)中学习,而无需通信原始数据。传统上,VFL包括一个“实体解析”阶段,其中主机识别并序列化所有客端已知的唯一实体。随后是私有集交集以查找共同实体,以及一个“实体对齐”步骤,以确保所有客端始终处理同一实体的数据。然而,仅使用交集内实体的数据意味着客端丢弃了可能有用的数据。此外,对隐私的影响存疑,且这些操作计算成本高昂。我们提出了一种新颖的方法,消除了分类任务中集交集和实体对齐的需要。我们的实体增强技术为发送给主机的激活生成有意义的标签,无论其源自哪个实体,从而实现了无需显式实体对齐的高效VFL。在训练数据重叠有限的情况下,该方法表现显著更好(例如,在CIFAR-10上,5%重叠时,测试准确率为48.1%对69.48%)。事实上,由于正则化效果,即使在100%重叠的情况下,我们的模型表现也略好。
引用
@article{arxiv.2406.17899,
title = {Entity Augmentation for Efficient Classification of Vertically Partitioned Data with Limited Overlap},
author = {Avi Amalanshu and Viswesh Nagaswamy and G. V. S. S. Prudhvi and Yash Sirvi and Debashish Chakravarty},
journal= {arXiv preprint arXiv:2406.17899},
year = {2024}
}
备注
GLOW @ IJCAI 2024 (12 pages + 2 page bibliography. 15 figures.)