基于大语言模型标记对齐的长程基因表达预测
机器学习
2024-10-04 v1 分布式、并行与集群计算
摘要
基因表达是一种细胞过程,在人类表型变异和疾病中发挥根本作用。尽管深度学习模型在基因表达预测方面取得了进展,但最近的基准测试揭示了其无法学习远端调控语法的能力。为此,我们利用预训练的大语言模型来增强基因表达预测。我们引入 Genetic sequence Token Alignment (GTA),该方法将基因序列特征与自然语言标记对齐,允许通过冻结语言模型进行基因组序列特征的符号推理。这种跨模态适应学习了调控语法,进而允许将基因特异的人类注释作为提示,实现无法被现有模型实现的情境学习。GTA 在淋巴细胞上进行训练后,在 Geuvadis 联盟的细胞上进行评估,超过 Enformer 等最先进模型,实现了 0.65 的 Spearman 相关系数,提升了 10%。此外,GTA 通过识别输入基因背景中最有意义的部分,提供了对长程相互作用的改进解释。GTA 代表了一种强大且新颖的跨模态方法,用于基因表达预测,利用预训练语言模型,标志着从仅基于序列数据训练的传统基因表达模型的范式转变。
引用
@article{arxiv.2410.01857,
title = {Learning the Optimal Path and DNN Partition for Collaborative Edge Inference},
author = {Yin Huang and Letian Zhang and Jie Xu},
journal= {arXiv preprint arXiv:2410.01857},
year = {2024}
}
备注
15 pages, 15 figures, submitted to IEEE journals for possible publication