中文

将 Transformer 与自编码器技术与谱图算法结合用于稀缺标记分子数据的预测

机器学习 2023-01-09 v2 定量方法

摘要

在分子与生物科学中,实验昂贵、耗时,且常受伦理约束。因此,人们常常面临从小数据集或稀缺标记数据集中预测理想属性的艰巨任务。尽管迁移学习可能有利,但它需要有相关大数据集的存在。本工作引入了三种结合 Merriman-Bence-Osher(MBO)技术的基于图的模型来应对这一挑战。具体而言,MBO 格式的基于图的改进与最先进技术相集成,包括一个自制的 transformer 和一个自编码器,以处理稀缺标记数据集。此外,详述了一种共识技术。所提出的模型使用五个基准数据集进行了验证。我们还提供了与其他竞争方法的透彻比较,例如支持向量机、随机森林和梯度提升决策树,这些方法以其在小数据集上的良好性能而闻名。使用残基相似度(R-S)分数和 R-S 指数分析了各种方法的性能。广泛的计算实验与理论分析表明,即使仅使用数据集的 1% 作为标记数据,新模型也表现非常好。

关键词

引用

@article{arxiv.2211.06759,
  title  = {Integrating Transformer and Autoencoder Techniques with Spectral Graph Algorithms for the Prediction of Scarcely Labeled Molecular Data},
  author = {Nicole Hayes and Ekaterina Merkurjev and Guo-Wei Wei},
  journal= {arXiv preprint arXiv:2211.06759},
  year   = {2023}
}