将 LLM 嵌入用于人类基因组变异的变异分析
应用统计
2026-04-01 v2 人工智能
基因组学
摘要
近期大语言模型(LLM)嵌入的快速进展为生物数据提供了强大的表示方法,但目前的大多数应用仅聚焦于基因层面的信息。我们提出了首个系统性框架,用于生成人类基因组中变异水平的嵌入表示。基于 FAVOR、ClinVar 和 GWAS Catalog 等精选注释数据,我们为 89 亿个可能的变异构建功能文本描述,并生成嵌入表示,覆盖三个尺度:150 万个 HapMap3/MEGA 变异、9000 万个已插值 UK Biobank(UKB)变异以及 90 亿个全部可能变异。采用通用模型生成嵌入,包括 OpenAI 的 text-embedding-3-large 以及开源的 Qwen3-Embedding-0.6B。基线质量控制实验表明,这些嵌入在预测变异水平属性方面具有高预测准确性,验证了其作为基因组变异结构化表示的有效性。我们进一步将其应用于基于 LLM 嵌入的基因风险预测,展示了在 UK Biobank 队列数据上进行 polygenic risk score(PRS)风格预测时的实际应用效果。这些资源已公开发布在 Hugging Face 上,为大规模基因组发现和精密医学的发展奠定了基础。
引用
@article{arxiv.2509.20702,
title = {Incorporating LLM Embeddings for Variation Across the Human Genome},
author = {Hongqian Niu and Jordan Bryan and Jacob Williams and Hufeng Zhou and Haoyu Zhang and Xihao Li and Didong Li},
journal= {arXiv preprint arXiv:2509.20702},
year = {2026}
}