双曲空间基因组嵌入
机器学习
2025-07-30 v1
摘要
当前基因组序列建模方法往往难以匹配机器学习模型的归纳偏置与生物系统演化导向结构之间的关系。为此,我们提出一种新颖的双曲空间 CNN 应用,充分利用这种结构,实现更具表达力的 DNA 序列表征。我们的策略规避了显式的系谱映射需求,同时辨识序列与核心功能及调控行为相关的关键属性。在 42 个基因解释基准数据集中的 37 个数据集上,我们的双曲模型超越了其欧几里得等价模型。值得注意的是,我们的方法甚至在七个 GUE 基准数据集上实现了最先进性能,持续超越许多 DNA 语言模型,却使用数量级更少的参数且无需预训练。我们的工作包括一套新颖的基准数据集——可转位元件基准 (Transposable Elements Benchmark),探讨了基因组中具有深层演化意义的重要但鲜受关注的组成部分。我们进一步通过探讨双曲模型在各种数据生成条件下识别基因组信号的能力,以及构建一种用于解释数据集嵌入双曲性的经验方法。通过这些评估,我们发现双曲框架作为基因组表征学习的稳健范式具有持久的潜力。我们的代码和基准数据集已提供于 https://github.com/rrkhan/HGE。
引用
@article{arxiv.2507.21648,
title = {Hyperbolic Genome Embeddings},
author = {Raiyan R. Khan and Philippe Chlenski and Itsik Pe'er},
journal= {arXiv preprint arXiv:2507.21648},
year = {2025}
}
备注
30 pages, 16 figures, 10 tables. Camera-ready version for ICLR 2025