中文

用于蛋白质结构相似性搜索的哈希方法

机器学习 2024-11-14 v1 人工智能 定量方法

摘要

蛋白质结构相似性搜索(PSSS)旨在搜索具有相似结构的蛋白质,在药物设计、蛋白质功能预测和分子进化等多个领域发挥着关键作用。传统的基于比对的PSSS方法直接计算蛋白质结构上的比对,耗时极长且内存开销高。近来提出了基于比对自由的方法,将蛋白质结构表示为定长实值向量,用于PSSS。虽然这些方法比基于比对的方法时间和内存开销更低,但其开销对于大规模PSSS仍过高,且准确性不尽如人意。本文提出了一种新方法,称为蛋白质结构哈希(POSH),用于PSSS。POSH为每个蛋白质结构学习二进制向量表示,与实值向量表示方法相比,可大幅降低PSSS的时间和内存开销。此外,POSH还提出了富有表达力的手工特征和结构编码器,以良好地建模蛋白质中的节点和边交互。真实数据集上的实验结果表明,POSH能超越其他方法达到最先进的准确性。此外,与其他方法相比,POSH实现了六倍以上的内存节省和四倍以上的速度提升。

关键词

引用

@article{arxiv.2411.08286,
  title  = {Hashing for Protein Structure Similarity Search},
  author = {Jin Han and Wu-Jun Li},
  journal= {arXiv preprint arXiv:2411.08286},
  year   = {2024}
}