中文

数据协作分析在化合物数据集上的应用及投影数据对非IID设置的引入

机器学习 2023-08-02 v1

摘要

鉴于药物上市所需的时间和费用,已有大量研究利用机器学习基于化合物结构预测其性质。联邦学习已被应用于化合物数据集,以在保护潜在专有信息的同时提升预测精度。然而,联邦学习在非独立同分布(non-IID)设置下精度较低,即数据划分具有较大标签偏置,并被认为不适用于往往具有较大标签偏置的化合物数据集。为应对此局限,我们对来自开源的化合物数据采用了一种称为数据协作分析(DC)的分布式机器学习替代方法。我们还提出了使用投影数据的数据协作分析(DCPd),这是一种利用辅助PubChem数据的改进方法。这提升了用于生成中间表示的投影数据的各用户端数据变换质量。我们在五个化合物数据集上比较了联邦平均(FedAvg)、DC与DCPd的分类精度,即受试者工作特征曲线下面积(ROC-AUC)与精确率-召回率曲线下面积(PR-AUC)。我们确定在非IID设置下机器学习性能顺序为DCPd、DC、FedAvg,而在独立同分布(IID)设置下三者几乎相同。此外,结果表明与其他方法相比,DCPd在不同程度标签偏置的实验中分类精度下降可忽略。因此,DCPd可解决联邦学习的挑战之一——非IID设置下的低性能。

关键词

引用

@article{arxiv.2308.00280,
  title  = {Data Collaboration Analysis applied to Compound Datasets and the Introduction of Projection data to Non-IID settings},
  author = {Akihiro Mizoguchi and Anna Bogdanova and Akira Imakura and Tetsuya Sakurai},
  journal= {arXiv preprint arXiv:2308.00280},
  year   = {2023}
}