中文

面向计算药物重定位中标签稀疏性的自监督学习

机器学习 2022-06-02 v1 信息检索 生物大分子

摘要

计算药物重定位旨在发现已上市药物的新用途,能够加速药物开发进程,并在现有药物发现体系中发挥重要作用。然而,与现实中药物和疾病的数量相比,已验证的药物-疾病关联数量极为稀少。过少的标注样本会使分类模型无法学习到药物有效的潜在因子,导致泛化性能不佳。在本工作中,我们提出了一种面向计算药物重定位的多任务自监督学习框架。该框架通过学习更好的药物表示来解决标签稀疏性问题。具体而言,我们将药物-疾病关联预测问题作为主任务,辅助任务是利用数据增强策略和对比学习来挖掘原始药物特征的内部关系,从而在无监督标签的情况下自动学习更好的药物表示。并通过联合训练,确保辅助任务能够提升主任务的预测精度。更确切地说,辅助任务改善了药物表示,并作为额外的正则化项以提升泛化能力。此外,我们设计了一个多输入解码网络来提升自编码器模型的重构能力。我们使用三个真实世界数据集对模型进行了评估。实验结果证明了该多任务自监督学习框架的有效性,其预测能力优于最先进的模型。

关键词

引用

@article{arxiv.2206.00262,
  title  = {Self-supervised Learning for Label Sparsity in Computational Drug Repositioning},
  author = {Xinxing Yang and Genke Yang and Jian Chu},
  journal= {arXiv preprint arXiv:2206.00262},
  year   = {2022}
}

备注

14 pages