上下文表示锚点网络以缓解少样本药物发现中的选择偏差
机器学习
2024-10-30 v2 人工智能
生物大分子
摘要
在药物发现过程中,候选药物筛选的低成功率往往导致标注数据不足,引发分子性质预测中的少样本学习问题。现有的少样本分子性质预测方法忽略了样本选择偏差,该偏差源于化学实验中非随机的样本选择。数据代表性上的这种偏差会导致性能次优。为克服这一挑战,我们提出了一种名为上下文表示锚点网络(CRA)的新方法,其中锚点是指分子表示的聚类中心,并作为桥梁将丰富的上下文知识转移到分子表示中以增强其表达能力。CRA 引入了双重增强机制,包括上下文增强和锚点增强:前者动态检索相似的未标注分子并捕获其任务特定的上下文知识以增强锚点;后者利用锚点来增强分子表示。我们在 MoleculeNet 和 FS-Mol 基准以及领域迁移实验中评估了该方法。结果表明,CRA 在 AUC 和 AUC-PR 指标上分别比 state-of-the-art 高出 2.60% 和 3.28%,并展现出卓越的泛化能力。
引用
@article{arxiv.2410.20711,
title = {Contextual Representation Anchor Network to Alleviate Selection Bias in Few-Shot Drug Discovery},
author = {Ruifeng Li and Wei Liu and Xiangxin Zhou and Mingqian Li and Qiang Zhang and Hongyang Chen and Xuemin Lin},
journal= {arXiv preprint arXiv:2410.20711},
year = {2024}
}
备注
13 pages, 7 figures