NbBench:面向综合纳米抗体任务的基准测试语言模型
机器学习
2025-07-29 v2 生物大分子
摘要
纳米抗体——源自骆驼科动物仅重链抗体的单域抗体片段——展现出独特的优势,如尺寸紧凑、稳定性高和结合亲和力强,使其成为治疗和诊断领域的重要工具。尽管预训练的蛋白质和抗体语言模型(PPLM 和 PALM)的最新进展极大地增强了对生物分子的理解,但纳米抗体特异性建模仍未被充分探索,且缺乏统一的基准。为弥补这一差距,我们引入了 NbBench,这是首个用于纳米抗体表示学习的综合基准套件。NbBench 涵盖九个精选数据集上的八项具有生物学意义的任务,包括结构注释、结合预测和可开发性评估。我们在冻结设置下系统地评估了十一个代表性模型,包括通用蛋白质语言模型、抗体特异性语言模型和纳米抗体特异性语言模型。我们的分析表明,抗体语言模型在抗原相关任务中表现出色,而在热稳定性和亲和力等回归任务上,所有模型的性能仍然具有挑战性。值得注意的是,没有单一模型能在所有任务中始终优于其他模型。通过标准化数据集、任务定义和评估协议,NbBench 为评估和推进纳米抗体建模提供了可复现的基础。
引用
@article{arxiv.2505.02022,
title = {NbBench: Benchmarking Language Models for Comprehensive Nanobody Tasks},
author = {Yiming Zhang and Koji Tsuda},
journal= {arXiv preprint arXiv:2505.02022},
year = {2025}
}