中文

基于核方法的非线性数据集成用于数据协作分析

机器学习 2026-05-27 v1 机器学习

摘要

去中心化且保密数据集的协同分析具有重要意义,但由于隐私和制度限制,往往不能直接共享原始数据集。数据协作(DC)分析通过各方特定的混淆函数将每个数据集转换为隐私-preserving 中间表示, 并通过锚点数据集将其整合到常见的协作表示中。然而, 许多现有的 DC 分析方法依赖线性变换进行数据混淆和集成, 这可能增加重构风险。虽然非线性降维可以缓解这一风险, 但常规的线性集成方法无法准确对齐由非线性变换产生的中间表示。此外, 现有的集成方法主要最小化各方之间的差异, 不会明确地纳入对下游分析有用的几何信息或目标变量信息。为克服这些限制, 本文首先将线性核集成(LKI) formulated as 一种线性集成方法, 然后对其进行核化以获得非线性核集成(NKI)。NKI 通过核岭回归和特征值问题获得全局最优解。我们还引入图正则化和中心化约束, 以便目标表示能够捕获对下游分析有用的几何和目标变量信息。图像分类任务的实验表明, 在非线性降维下, NKI 在现有线性集成方法之上提高了分类准确率, 进一步通过目标变量感知的图正则化和中心化获得额外提升。结果还表明, 降维选择在分类准确率和重构风险方面具有显著影响。

关键词

引用

@article{arxiv.2605.27219,
  title  = {Nonlinear Data Integration via Kernel Methods for Data Collaboration Analysis},
  author = {Yamato Suetake and Yuta Kawakami and Shunnosuke Ikeda and Yuichi Takano},
  journal= {arXiv preprint arXiv:2605.27219},
  year   = {2026}
}

备注

50 pages, 7 figures