中文

面向大规模在线质谱的灵活自适应稳定聚类算法

机器学习 2026-05-11 v1

摘要

现代在线质谱生成多太字节数据流,对理解地球环境系统至关重要。然而,从这些存储库中提取可操作化学洞察受到了计算瓶颈的阻碍:现有聚类方法在可扩展性、度量灵活性和算法稳定性之间必须作出妥协。本文引入灵活自适应稳定聚类(FASC),这是一种动力系统框架,通过体系结构地将相似性核从严格的优化逻辑中解耦来解决这些约束。与遭受随机漂移和算法混合的旧式启发式方法不同,FASC采用密度增强相似性选择规则和几何约束,保证确定性、顺序无关的收敛。经过在标准机器学习基准测试验证(实现 >99.5% 聚类纯度和 0.99 调整 Rand 指数),我们将框架部署在2500万大气气溶胶质谱数据上。展示其严格的线性经验运行时间扩展(O(N)),FASC在20天内自主映射了二次无机气溶胶的大气老化路径,同时隔离了极稀有的工业轨迹物(<0.2% 丰度),为从大数据中挖掘环境信息提供了可扩展基础设施。

关键词

引用

@article{arxiv.2605.07424,
  title  = {A Flexible Adaptive Stable Clustering Algorithm for Archive-Scale Online Mass Spectrometry},
  author = {Shao Shi and Xin Yang and Huiran Feng and Jianhuai Ye and Tianlong Hu and Yaling Zeng and Tzung-May Fu and Lei Zhu and Huizhong Shen and Chen Wang and Shu Tao},
  journal= {arXiv preprint arXiv:2605.07424},
  year   = {2026}
}