抗体基础模型:Ab-RoBERTa
机器学习
2025-06-17 v1
摘要
随着基于抗体的治疗方法的日益突出,抗体工程作为研究和开发的关键领域获得了越来越多的关注。基于Transformer的蛋白质大语言模型(LLM)的最新进展在蛋白质序列设计和结构预测方面展示了广阔的应用前景。此外,大规模抗体数据集(如观测抗体空间(OAS)数据库)的可用性为开发专门处理抗体序列的LLM开辟了新的途径。其中,RoBERTa相较于BERT展示了更优的性能,同时参数规模(125M)小于基于BERT的蛋白质模型ProtBERT(420M)。这种缩减的模型规模使得抗体相关应用中的部署更加高效。然而,尽管RoBERTa架构具有众多优势,基于其构建的抗体专用基础模型对研究界而言仍然不可获取。在本研究中,我们引入了Ab-RoBERTa,一个基于RoBERTa的抗体专用LLM,该模型在https://huggingface.co/mogam-ai/Ab-RoBERTa上公开可用。该资源旨在支持广泛的抗体相关研究应用,包括抗原表位预测或人源化评估。
引用
@article{arxiv.2506.13006,
title = {Antibody Foundational Model : Ab-RoBERTa},
author = {Eunna Huh and Hyeonsu Lee and Hyunjin Shin},
journal= {arXiv preprint arXiv:2506.13006},
year = {2025}
}
备注
14 page, 3 figures, 5 tables