中文

基于化学知识的隐私保护的反向合成学习框架

机器学习 2025-06-26 v2 人工智能

摘要

化学反应数据是推动制药、材料科学和工业化学等竞争领域进步的关键资产。其专有属性使其具有敏感性,因为通常包括机密见解和组织所致的竞争优势。然而,与此需求相比,当前基于机器学习的反向合成的标准训练范式将反应数据从多个来源收集到单个边缘以训练预测模型。这一范式带来了显著的隐私风险,因为需要在组织边界之间广泛的数据可用性以及频繁的数据传输,可能在存储和传输期间将专有信息暴露给未授权的访问或拦截。在本研究中,我们引入了化学知识信息框架(CKIF),一种用于学习反向合成模型的隐私保护方法。CKIF实现了跨多个化学组织的分布式训练,而不损害专有反应数据的保密性。相反地,CKIF通过模型参数的迭代、化学知识信息的聚合来学习反向合成模型。特别地,利用预测反应物的化学属性来量化评估单个模型的可观察行为,从而确定用于模型聚合的自适应权重。在各种反应数据集上,CKIF显著优于几个强大的基线方法。

关键词

引用

@article{arxiv.2502.19119,
  title  = {Chemical knowledge-informed framework for privacy-aware retrosynthesis learning},
  author = {Guikun Chen and Xu Zhang and Xiaolin Hu and Yong Liu and Yi Yang and Wenguan Wang},
  journal= {arXiv preprint arXiv:2502.19119},
  year   = {2025}
}