通过信息最大化消除分子表示中的偏差
机器学习
2023-12-04 v1 人工智能
生物大分子
摘要
高通量药物筛选——以细胞成像或基因表达测量作为药物效应的读出——是生物技术中评估和理解药物化学结构与生物活性关系的关键工具。由于大规模筛选必须划分为多个实验,一个关键难题在于处理批次效应,其会在数据中引入系统误差与非生物学关联。我们提出 InfoCORE,一种用于混杂因素去除的信息最大化方法(Information maximization approach for COnfounder REmoval),以有效应对批次效应并获得精炼的分子表示。InfoCORE 在给定批次标识下对潜表示的条件互信息建立了变分下界。它自适应地对样本重新加权,以均衡其隐含的批次分布。在药物筛选数据上的大量实验揭示了 InfoCORE 在分子属性预测与分子-表型检索等多项任务中的优越性能。此外,我们展示了 InfoCORE 如何提供一个通用框架,并通过最小化与伪特征的相关性 or 移除敏感属性来解决一般的分布偏移与数据公平性问题。代码见 https://github.com/uhlerlab/InfoCORE。
引用
@article{arxiv.2312.00718,
title = {Removing Biases from Molecular Representations via Information Maximization},
author = {Chenyu Wang and Sharut Gupta and Caroline Uhler and Tommi Jaakkola},
journal= {arXiv preprint arXiv:2312.00718},
year = {2023}
}