中文

PepBenchmark:面向肽类机器学习的标准化基准

机器学习 2026-04-14 v1 人工智能

摘要

肽类药物被视为第三代药物,但由于缺乏标准化基准,肽类机器学习 (ML) 进展受阻。本文提出 PepBenchmark,将肽类药物发现中的数据集、预处理和评估协议统一起来。PepBenchmark 包含三个组成部分:(1) PepBenchData,一个包含 29 个标准肽和 6 个非标准肽数据集的精选集合,覆盖 7 个组,系统性地涵盖肽类药物开发的关键方面,据我们所知,是目前最全面的 AI 就绪数据资源;(2) PepBenchPipeline,一个标准化的预处理管道,确保数据集清洗、构建、划分和特征转换的一致性,缓解常见于非正式管道的质量问题;(3) PepBenchLeaderboard,一个统一的评估协议和排行榜,覆盖 4 大方法族:指纹基、图神经网络基、语言模型基和 SMILES 基模型。总的来说,PepBenchmark 为肽类药物发现提供了第一个标准化且可比的基础,促进方法论进步并转化为实际应用。数据和代码已公开于 https://github.com/ZGCI-AI4S-Pep/PepBenchmark/。

关键词

引用

@article{arxiv.2604.10531,
  title  = {PepBenchmark: A Standardized Benchmark for Peptide Machine Learning},
  author = {Jiahui Zhang and Rouyi Wang and Kuangqi Zhou and Tianshu Xiao and Lingyan Zhu and Yaosen Min and Yang Wang},
  journal= {arXiv preprint arXiv:2604.10531},
  year   = {2026}
}