中文

HERP:面向蛋白质组学中节能实时数据库搜索与簇扩展的硬件

数据库 2025-11-25 v2 新兴技术

摘要

数据库搜索和聚类是许多数据分析问题(如质谱驱动的蛋白质组学)的基本组成部分。传统的全聚类和搜索算法存在资源消耗高、延迟长的问题。我们引入了HERP,一种轻量级增量聚类方法和一个高度可并行的数据库搜索平台,该平台利用基于7nm工艺3T2MTJ SOT-MRAM的CAM进行内存加速。使用预聚类的蛋白质组学数据进行一次硬件初始化,即可实现连续的数据库搜索和局部重聚类,为从头聚类提供了更实用、更高效的替代方案。从初始预聚类数据中推导出的启发式规则指导增量过程,以聚类误差增加0.3%的代价将聚类速度提升20倍,同时数据库搜索结果与SOTA算法的重叠率达到96%,验证了搜索质量。对于131GB的人类基因组蛋白质组数据集,HERP设置需要1.19mJ处理200万张谱图,而1000次查询搜索在达到SOTA精度时仅消耗1.1uJ。桶级并行化和查询调度提供了额外的100倍加速。

关键词

引用

@article{arxiv.2511.03437,
  title  = {HERP: Hardware for Energy Efficient and Realtime DB Search and Cluster Expansion in Proteomics},
  author = {Md Mizanur Rahaman Nayan and Zheyu Li and Flavio Ponzina and Sumukh Pinge and Tajana Rosing and Azad J. Naeemi},
  journal= {arXiv preprint arXiv:2511.03437},
  year   = {2025}
}