中文

CARE:用于酶分类与检索的基准套件

生物大分子 2025-06-13 v3 机器学习

摘要

酶是催化化学反应的重要蛋白质。近年来,机器学习方法涌现用于从序列预测酶功能;然而,尚无标准化基准进行评估。我们引入CARE,作为分类与检索酶(CARE)的基准和数据集套件。CARE中心包括两个任务:(1)按酶活化数(EC)编号分类蛋白质序列,(2)给定化学反应检索EC编号。对于每个任务,我们设计训练-测试划分以评估不同类型的离群注意力泛化,这些泛化与实际应用场景相关。对于分类任务,我们提供了针对最先进方法的基线。由于检索任务尚未形式化,我们提出了一种称为Contrastive Reaction-EnzymI Pretraining(CREEP)的方法作为该任务的首个基线之一,并与最近方法CLIPZyme进行比较。CARE可在https://github.com/jsunn-y/CARE/上获取。

关键词

引用

@article{arxiv.2406.15669,
  title  = {CARE: a Benchmark Suite for the Classification and Retrieval of Enzymes},
  author = {Jason Yang and Ariane Mora and Shengchao Liu and Bruce J. Wittmann and Anima Anandkumar and Frances H. Arnold and Yisong Yue},
  journal= {arXiv preprint arXiv:2406.15669},
  year   = {2025}
}