中文

基于哈希的对比学习虚拟筛选

人工智能 2024-07-30 v1

摘要

虚拟筛选 (VS) 是计算机辅助药物发现中的关键步骤,旨在识别与特定目标受体(如蛋白质)结合的分子。传统的 VS 方法,如对接方法,往往在筛选大规模分子数据库时耗时过长。近期的深度学习进展表明,使用对比学习为蛋白质和分子学习向量表示可超过传统对接方法。然而,鉴于目标数据库常常包含数十亿分子,现有方法采用实值向量表示在 VS 中仍会产生显著的内存和时间成本。为解决此问题,本文提出一种基于哈希的对比学习方法,称为 DrugHash,用于 VS。DrugHash 将 VS 视为一个使用高效二进制哈希码进行检索的任务。具体而言,DrugHash 设计了一种简单而有效的哈希策略,以实现蛋白质和分子两种模态二进制哈希码的端到端学习,从而在更高准确率下大幅降低内存和时间成本。实验结果表明,DrugHash 能超过现有方法,实现最佳准确率,内存节省 32 倍,速度提升 3.5 倍。

关键词

引用

@article{arxiv.2407.19790,
  title  = {Hashing based Contrastive Learning for Virtual Screening},
  author = {Jin Han and Yun Hong and Wu-Jun Li},
  journal= {arXiv preprint arXiv:2407.19790},
  year   = {2024}
}