中文

CLCLSA:基于跨组学关联嵌入与对比学习及自注意力的不完整多组学数据整合方法

机器学习 2023-04-13 v1 人工智能 基因组学

摘要

异质高维多组学数据的整合在理解遗传数据方面正变得愈发重要。每种组学技术仅提供对潜在生物过程的有限视角,而同时整合异质组学层将带来对疾病与表型更全面细致的理解。然而,执行多组学数据整合时面临的一个障碍是由于仪器灵敏度与成本导致的非配对多组学数据的存在。若研究对象的某些方面缺失或不完整,研究可能会失败。在本文中,我们提出了一种针对不完整数据的多组学整合深度学习方法:基于跨组学关联统一嵌入与对比学习及自注意力(CLCLSA)。该方法利用完整多组学数据作为监督,采用跨组学自编码器学习不同类型生物数据间的特征表示。在多组学潜特征拼接之前,采用用于最大化不同组学间互信息的多组学对比学习。此外,采用特征级自注意力与组学级自注意力来动态识别对多组学数据整合最具信息量的特征。我们在四个公开多组学数据集上进行了大量实验。实验结果表明,所提出的 CLCLSA 在使用不完整多组学数据进行多组学数据分类方面优于当前最优方法。

关键词

引用

@article{arxiv.2304.05542,
  title  = {CLCLSA: Cross-omics Linked embedding with Contrastive Learning and Self Attention for multi-omics integration with incomplete multi-omics data},
  author = {Chen Zhao and Anqi Liu and Xiao Zhang and Xuewei Cao and Zhengming Ding and Qiuying Sha and Hui Shen and Hong-Wen Deng and Weihua Zhou},
  journal= {arXiv preprint arXiv:2304.05542},
  year   = {2023}
}

备注

21 pages; 5 figures