面向基因组理解的语言模型高效可扩展微调
基因组学
2024-02-14 v1 人工智能
机器学习
摘要
尽管 DNA 基础模型推进了对基因组的理解,但它们在基因组数据的规模和多样性有限方面仍面临重大挑战。这一局限与自然语言基础模型的成功形成了鲜明对比,后者在更大的规模上蓬勃发展。此外,基因组理解涉及众多具有内在数据异质性的下游基因组注释任务,因此需要针对基因组学量身定制的更高效、更稳健的微调方法。在此,我们提出了 \textsc{Lingo}:面向基因组的语言前缀微调 (\textsc{L}anguage prefix f\textsc{In}e-tuning for \textsc{G}en\textsc{O}mes)。与 DNA 基础模型不同,\textsc{Lingo} 策略性地利用自然语言基础模型的上下文线索,将其语言知识重新校准到基因组序列上。\textsc{Lingo} 进一步通过自适应秩采样方法适应众多异构的下游微调任务,该方法在较小的计算预算内修剪并随机重新引入被修剪的奇异向量。自适应秩采样在所有基准测试的 14 项基因组理解任务上均优于现有的微调方法,同时所需的可训练参数少于 2%,作为基因组特异性适配器。令人印象深刻的是,将这些适配器应用于自然语言基础模型,其性能匹配甚至超越了 DNA 基础模型。\textsc{Lingo} 提出了一种通过语言模型上的基因组特异性适配器实现高效且可扩展的基因组理解的新范式。
引用
@article{arxiv.2402.08075,
title = {Efficient and Scalable Fine-Tune of Language Models for Genome Understanding},
author = {Huixin Zhan and Ying Nian Wu and Zijun Zhang},
journal= {arXiv preprint arXiv:2402.08075},
year = {2024}
}