HyenaDNA:单核苷酸分辨率下的长程基因组序列建模
摘要
基因组(DNA)序列编码了用于基因调控和蛋白质合成的大量信息。与自然语言模型类似,研究者已在基因组学中提出基础模型,从未标记的基因组数据中学习可泛化的特征,然后可微调用于下游任务,如识别调控元件。由于注意力的二次方扩展,先前基于 Transformer 的基因组模型使用 512 到 4k 个 token 作为上下文(小于人类基因组的 0.001%),显著限制了对 DNA 中长程相互作用的建模。此外,这些方法依赖分词器或固定 k-mers 来聚合有意义的 DNA 单元,丢失了单核苷酸分辨率,而细微的遗传变异可通过单核苷酸多态性(SNPs)完全改变蛋白质功能。最近,基于隐式卷积的大语言模型 Hyena 被证明在质量上匹配注意力,同时允许更长的上下文长度和更低的时间复杂度。利用 Hyena 新的长程能力,我们提出 HyenaDNA,一个在人类参考基因组上预训练的基因组基础模型,具有高达 100 万 token 的上下文长度且处于单核苷酸级别——比先前基于稠密注意力的模型最多增加 500 倍。HyenaDNA 在序列长度上以次二次方扩展(训练比 Transformer 快至多 160 倍),使用单核苷酸 token,并在每一层具有完整的全局上下文。我们探索了更长上下文所赋能的能力——包括基因组学中上下文学习(in-context learning)的首次使用。在来自 Nucleotide Transformer 的微调基准上,HyenaDNA 在 18 个数据集中有 12 个达到最先进水平(SotA),使用的模型参数量和预训练数据量少几个数量级。在 GenomicBenchmarks 上,HyenaDNA 在 8 个数据集中的 7 个上平均以 +10 准确率点超越 SotA。代码见 https://github.com/HazyResearch/hyena-dna。
引用
@article{arxiv.2306.15794,
title = {HyenaDNA: Long-Range Genomic Sequence Modeling at Single Nucleotide Resolution},
author = {Eric Nguyen and Michael Poli and Marjan Faizi and Armin Thomas and Callum Birch-Sykes and Michael Wornow and Aman Patel and Clayton Rabideau and Stefano Massaroli and Yoshua Bengio and Stefano Ermon and Stephen A. Baccus and Chris Ré},
journal= {arXiv preprint arXiv:2306.15794},
year = {2023}
}
备注
NeurIPS 2023 (Spotlight)