中文

SARS-CoV-2 相互作用数据集与 VHH 序列语料库用于抗体语言模型

机器学习 2024-10-17 v3 基因组学

摘要

抗体是免疫系统产生的关键蛋白,用于消除有害外物质,已成为治疗人类疾病的关键疗法。为加速抗体疗法的发现,越来越多的人关注构建抗体序列的语言模型。然而,由于缺乏标记数据集,尚未充分评估预训练语言模型在抗体发现中的适用性。为克服这些限制,我们引入了 AVIDa-SARS-CoV-2,一个包含来自两只接种了 SARS-CoV-2 刺突蛋白的骆驼产生的抗体-可变重链 (VHH) 相互作用数据的数据集。AVIDA-SARS-CoV-2 包括指示不同 VHH 序列与 12 种 SARS-CoV-2 突变体(如 Delta 和 Omicron 变体)结合或不结合的二元标签。此外,我们发布了 VHHCorpus-2M,包含超过 200 万 VHH 序列的预训练数据集,用于抗体语言模型。我们报告了使用在 VHHCorpus-2M 上预训练的 VHHBERT 以及现有通用蛋白和抗体特定预训练语言模型预测 SARS-CoV-2-VHH 结合的基准结果。这些结果确认 AVIDa-SARS-CoV-2 为评估抗体语言模型在结合预测中的表示能力提供了有价值的基准,促进了基于 AI 的抗体发现。数据集可在 https://datasets.cognanous.com 提供。

关键词

引用

@article{arxiv.2405.18749,
  title  = {A SARS-CoV-2 Interaction Dataset and VHH Sequence Corpus for Antibody Language Models},
  author = {Hirofumi Tsuruta and Hiroyuki Yamazaki and Ryota Maeda and Ryotaro Tamura and Akihiro Imura},
  journal= {arXiv preprint arXiv:2405.18749},
  year   = {2024}
}