跨多个主成分分析研究的知识迁移
机器学习
2024-03-13 v1 机器学习
摘要
迁移学习已引起统计学界的极大兴趣。在本文中,我们专注于无监督学习任务的知识迁移,这与文献中的监督学习任务形成对比。给定可迁移的源总体,我们提出了一种两步迁移学习算法,从多个源主成分分析 (PCA) 研究中提取有用信息,从而提高目标 PCA 任务的估计精度。在第一步中,我们通过一种称为格拉斯曼重心 (Grassmannian barycenter) 的方法整合了多个研究中的共享子空间信息,而不是直接在合并的数据集上执行 PCA。所提出的格拉斯曼重心方法在更一般的情况下具有鲁棒性和计算优势。然后,利用第一步得到的共享子空间估计量,在第二步中进一步估计目标的私有子空间。我们的理论分析将 PCA 研究间知识迁移的收益归因于增大的特征值间隙,这与现有监督迁移学习任务中稀疏性起核心作用的情况不同。此外,我们证明了在知识迁移后,经验谱投影算子的双线性形式在较弱的特征值间隙条件下具有渐近正态性。当信息源集合未知时,我们通过求解格拉斯曼流形上的修正优化问题,赋予我们的算法选择有用数据集的能力,这进而导致了一种计算友好的修正格拉斯曼 K-means 过程。最后,我们报告了广泛的数值模拟结果和一个关于活动识别的真实数据案例,以支持我们的理论主张并说明所提出的迁移学习方法的实证有用性。
引用
@article{arxiv.2403.07431,
title = {Knowledge Transfer across Multiple Principal Component Analysis Studies},
author = {Zeyu Li and Kangxiang Qin and Yong He and Wang Zhou and Xinsheng Zhang},
journal= {arXiv preprint arXiv:2403.07431},
year = {2024}
}