中文

Vendiscope:面向数据集合的算法显微镜

机器学习 2025-02-18 v1 材料科学 人工智能 定量方法

摘要

显微镜技术自 16 世纪末发明以来不断演进,持续提升我们探索和理解微观世界的能力,使得对结构和现象的观察日益精细。与此同时,数据驱动科学的兴起凸显了采用复杂方法探索和理解复杂数据集合构成的必要性。本文介绍了 Vendiscope,这是首个旨在将传统显微镜技术扩展至计算分析的算法显微镜。Vendiscope 利用了 Vendi 分数——一族源于生态学和量子力学的可微多样性度量指标——并根据数据点对集合整体多样性的贡献为其分配权重。这些权重实现了大规模的高分辨率数据分析。我们在生物学、材料科学和机器学习 (ML) 领域对此进行了演示。我们分析了蛋白质宇宙中的 2.52.5 亿个蛋白质序列,发现超过 22 亿个是近似重复项,且 AlphaFold 在对多样性贡献最大的 Gene Ontology (GO) 功能蛋白质上表现不佳。将 Vendiscope 应用于 Materials Project 数据库得出了类似结论:超过 85%85\% 具有形成能数据的晶体是近似重复项,且 ML 模型在增强多样性的材料上表现不佳。此外,Vendiscope 还可用于研究生成模型中的记忆现象。我们使用 Vendiscope 从 1313 个不同的生成模型中识别出了被记忆的训练样本,发现表现最好的模型通常记忆的是对多样性贡献最小的训练样本。我们的研究结果表明,Vendiscope 可以作为数据驱动科学的强大工具。

关键词

引用

@article{arxiv.2502.10828,
  title  = {The Vendiscope: An Algorithmic Microscope For Data Collections},
  author = {Amey P. Pasarkar and Adji Bousso Dieng},
  journal= {arXiv preprint arXiv:2502.10828},
  year   = {2025}
}

备注

This paper introduces the concept of "algorithmic microscopes" and proposes the Vendiscope, an algorithmic microscope for data-driven science