中文

面向AI驱动科学发现的GFlowNets

机器学习 2023-06-28 v2

摘要

解决人类最紧迫的问题,如气候危机和全球大流行的威胁,需要加速科学发现的步伐。虽然科学传统上在很大程度上依赖试错甚至偶然发现,但过去几十年见证了数据驱动科学发现的激增。然而,为了真正利用大规模数据集和高通量实验装置,机器学习方法需要进一步改进并更好地整合到科学发现流程中。当前机器学习方法在此背景下的一个关键挑战是非常大搜索空间的高效探索,这需要估计可归约(认知)不确定性的技术,以及生成待执行的多样且信息丰富的实验集合。这催生了一种称为GFlowNets的新概率机器学习框架,它可应用于实验科学循环中的建模、假设生成和实验设计阶段。GFlowNets学习从由对应于非归一化概率的奖励函数间接给定的分布中采样,从而能够采样多样、高奖励的候选者。GFlowNets还可用于形成以已获取实验数据为条件的因果模型的高效且可分摊的贝叶斯后验估计器。拥有此类后验模型随后可提供认知不确定性和信息增益的估计量,以驱动实验设计策略。总之,我们将在此论证GFlowNets可成为AI驱动科学发现的宝贵工具,尤其是在我们可获得廉价但不精确的测量或昂贵但精确的测量的极大候选空间场景中。这是药物与材料发现背景下的常见设定,我们在全文以此为例。

关键词

引用

@article{arxiv.2302.00615,
  title  = {GFlowNets for AI-Driven Scientific Discovery},
  author = {Moksh Jain and Tristan Deleu and Jason Hartford and Cheng-Hao Liu and Alex Hernandez-Garcia and Yoshua Bengio},
  journal= {arXiv preprint arXiv:2302.00615},
  year   = {2023}
}

备注

31 pages, 5 figures. Updated with camera-ready changes