中文

分子数据的联邦数据多样性分析探析

机器学习 2026-05-07 v1 人工智能

摘要

AI方法日益影响药物发现,但其向工业应用的转化仍受限于依赖公开数据集,缺乏规模和多样性。联邦学习( FL)提供了一种在隐私保护下通过数据孤岛整合私有数据的 promising方法。这种联邦数据访问 complicates重要的数据中心任务,如估计数据多样性、进行明智的数据划分以及理解组合化学空间的结构。为此,我们调查联邦聚类方法如何分离和表示分布式分子数据。我们在八个多样化的分子数据集上对三种方法进行基准测试:联邦k均值( Fed-kMeans)、联邦主成分分析结合Fed-kMeans( Fed-PCA+Fed-kMeans)以及联邦局部敏感哈希( Fed-LSH),并引入一种基于化学学知识的评估指标SF-ICF。大规模基准测试结合深入的可解释性分析表明,纳入领域知识通过化学信息化指标以及联邦端可解释性分析对于分子数据的联邦多样性分析至关重要。

关键词

引用

@article{arxiv.2510.19535,
  title  = {Insights into the Unknown: Federated Data Diversity Analysis on Molecular Data},
  author = {Markus Bujotzek and Evelyn Trautmann and Calum Hand and Ian Hales},
  journal= {arXiv preprint arXiv:2510.19535},
  year   = {2026}
}