中文

用于异构数据整合的表示检索学习

机器学习 2025-12-10 v3 统计方法学

摘要

在大数据时代,大规模、多源、多模态数据集日益普遍,为预测建模和科学发现提供了前所未有的机会。然而,这些数据集通常表现出复杂的异构性,如协变量偏移、后验漂移和分块缺失,从而恶化了现有监督学习算法的预测性能。为同时应对这些挑战,我们提出了一种新颖的表示检索(R2)框架,它将表示学习模块字典(表示器字典)与数据源特定的稀疏诱导机器学习模型(学习器)相整合。在R2框架下,我们为每个表示器引入了可整合性的概念,并提出了一种新颖的选择性整合惩罚(SIP),以明确鼓励更具整合性的表示器来提升预测性能。理论上,我们证明了R2框架的额外风险界由表示器的可整合性刻画,且SIP有效改善了额外风险。广泛的模拟研究验证了R2框架的优越性能以及SIP的效果。我们进一步将方法应用于两个真实数据集以确认其实证成功。

关键词

引用

@article{arxiv.2503.09494,
  title  = {Representation Retrieval Learning for Heterogeneous Data Integration},
  author = {Qi Xu and Annie Qu},
  journal= {arXiv preprint arXiv:2503.09494},
  year   = {2025}
}