人类基因组书:词语、句子与段落
其他定量生物学
2025-01-29 v1
摘要
自 2001 年人类基因组测序项目完成以来,在基因调控、蛋白质结构预测等领域取得了显著进展。然而,鉴于基因数据的庞大,能够得到完全注释并理解的片段仍相对有限。如果将基因组视为一本书,构建其“词”、“句”和“段落”等价物一直是长期且受欢迎的研究方向。最近,大语言模型中的迁移学习研究提供了一种新颖的方法来应对这一挑战。多语言迁移能力,这种能力衡量模型在源语言上微调后如何应用于其他语言,已在多语言预训练模型中得到广泛研究。类似地,自然语言能力向“DNA 语言”的迁移也已得到验证。基于这些发现,我们首先训练了一个基础模型,能够将语言能力从英文迁移到 DNA 序列。使用该模型,我们构建了 DNA 词汇的词汇表,并将 DNA 词映射到其英文等效物。随后,我们使用英文数据集对该模型进行微调,以开发用于句子和段落分割的模型。利用这些模型,我们处理了 GRCh38.p14 人类基因组,将其分割、标记化并组织成一个包含基因组“词”、“句”和“段落”的“书”。此外,基于 DNA 到英文的词汇映射,我们创建了一个该基因组书的“英文版”。本研究为理解基因组提供了一种新视角,并为开发用于 DNA 搜索、生成和分析的创新工具提供了激动人心的可能性。
引用
@article{arxiv.2501.16982,
title = {Human Genome Book: Words, Sentences and Paragraphs},
author = {Wang Liang},
journal= {arXiv preprint arXiv:2501.16982},
year = {2025}
}
备注
17 pages,5 figures