中文

基于正未标记学习的全基因组关联研究表型刻画

应用统计 2023-04-28 v1 机器学习

摘要

识别表型在通过医疗与健康科学中的实际应用增进我们对疾病生物学的理解方面发挥着重要作用。电子健康记录(EHRs)中复杂性与噪声带来的挑战,推动了机器学习在表型发现中的应用。尽管近期研究聚焦于寻找用于临床决策支持的预测性亚型,我们在此关注导致表型误分类的噪声,其会降低表型在全基因组关联研究(GWAS)中检测关联的能力。我们表明,通过将锚学习(anchor learning)与 transformer 架构结合进我们提出的模型 AnchorBERT,我们能够以仅多 5×\times 病例数的规模,检测出此前仅在大型联盟研究中发现的基因组关联。当可用对照数量减少 50\% 时,我们发现相比标准表型定义,我们的模型能从 GWAS 目录中多维持 40\% 的显著基因组关联。

关键词

引用

@article{arxiv.2202.07451,
  title  = {Phenotyping with Positive Unlabelled Learning for Genome-Wide Association Studies},
  author = {Andre Vauvelle and Hamish Tomlinson and Aaron Sim and Spiros Denaxas},
  journal= {arXiv preprint arXiv:2202.07451},
  year   = {2023}
}