TheBioCollection:用于生物学的统一预训练规模 LLM 语料库
定量方法
2026-07-09 v1 人工智能
机器学习
摘要
对生物学大语言模型 (BioLM) 的推动产生了对能够赋予模型真正生物学理解的训练语料库的需求。然而,现有的生物资源,如分子数据库、蛋白质存储库、基因组注释、单细胞图谱和通路数据库,分散在各种异构格式中,尚未组织成一个用于语言模型训练的连贯语料库。我们提出了 TheBioCollection,一个 52.6B token 的预训练规模语料库,将这些不同的资源转换为统一的、可直接用于训练的形式,涵盖小分子、蛋白质、基因组序列、细胞和通路。除了整合现有数据,TheBioCollection 还使用工具计算的生物学特性丰富了每条记录,并引入了当前语料库几乎未覆盖的能力的新指令任务。我们将该语料库与 TheBioCollection-Eval 配对,这是一个匹配的评估套件,用于探测分子、蛋白质、基因组、细胞和跨域设置中的识别、生成和预测能力。保持基础 Gravity-16B-A3B 架构不变,在 TheBioCollection 上训练使其在 TheBioCollection-Eval 上的总分提高了一倍以上,每个领域都有所提升,同时几乎保持了一般语言能力不变。
引用
@article{arxiv.2607.08803,
title = {TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology},
author = {Hyunjin Seo and Hyeon Hwang and Gyubok Lee and Jay Shin and Jimin Park and Taesoo Kim and Sanghoon Lee and Hongjoon Ahn and Sungjun Han and Sangwon Jung},
journal= {arXiv preprint arXiv:2607.08803},
year = {2026}
}