中文

用于多视图分析的协同学习

统计方法学 2022-10-12 v6 定量方法 机器学习

摘要

我们提出一种针对多组特征(“视图”)监督学习的新方法。多视图问题在生物学和医学中尤为重要,其中诸如基因组学、蛋白质组学和放射组学等“组学”数据是在一组公共样本上测量的。协同学习将通常的预测平方误差损失与“一致性”惩罚相结合,以鼓励来自不同数据视图的预测相互一致。通过改变一致性惩罚的权重,我们得到一系列连续的解决方案,其中包括众所周知的早期融合和晚期融合方法。协同学习以自适应方式选择一致性(或融合)的程度,使用验证集或交叉验证来估计测试集预测误差。我们一种拟合过程是模块化的,可选择适用于不同数据视图的不同拟合机制(例如 lasso、随机森林、提升、神经网络)。在协同正则化线性回归设定下,该方法将 lasso 惩罚与一致性惩罚结合,产生特征稀疏性。当不同数据视图的信号中存在某些可借以增强信号的潜在关系时,该方法尤其强大。我们表明协同学习在模拟数据和 labor onset 预测的实在多组学示例上取得了更高的预测精度。通过利用对齐信号并允许针对不同模态的灵活拟合机制,协同学习为多组学数据融合提供了一种有力方法。

关键词

引用

@article{arxiv.2112.12337,
  title  = {Cooperative learning for multiview analysis},
  author = {Daisy Yi Ding and Shuangning Li and Balasubramanian Narasimhan and Robert Tibshirani},
  journal= {arXiv preprint arXiv:2112.12337},
  year   = {2022}
}