通过本体增强嵌入模型增强神经退行性疾病研究的组学队列发现
计算与语言
2025-06-17 v1
摘要
为神经退行性疾病(ND)生成的组学和临床数据量不断增长,需要新的策展方法,以便它们可以在生物信息学中直接使用。NeuroEmbed是一种用于构建语义精确的嵌入空间以表示队列和样本的方法。NeuroEmbed方法包括四个阶段:(1) 从公共存储库中提取ND队列;(2) 使用生物医学本体和嵌入空间上的聚类对队列和样本的元数据进行半自动标准化和增强;(3) 基于标准化元数据维度的随机组合,自动生成用于队列和样本的自然语言问答(QA)数据集;(4) 微调领域特定的嵌入器以优化查询。我们使用GEO存储库和PubMedBERT预训练嵌入器来说明该方法。应用NeuroEmbed,我们对2,801个存储库和150,924个样本进行了语义索引。在许多与生物学相关的类别中,我们将来自GEO的1,700多个异质性组织标签标准化为326个独特的本体对齐概念,并用新的本体对齐术语丰富了注释,导致元数据术语的大小增加了2.7到20倍。在使用扩大的元数据增强的QA训练数据微调PubMedBERT后,该模型的平均检索精度从0.277提高到0.866,平均百分位数排名从0.355提高到0.896。用于创建组学队列和样本电子目录的NeuroEmbed方法将促进自动化生物信息学管道的构建。NeuroEmbed的队列和样本目录可在 https://github.com/JoseAdrian3/NeuroEmbed 获取。
引用
@article{arxiv.2506.13467,
title = {Enhancing Omics Cohort Discovery for Research on Neurodegeneration through Ontology-Augmented Embedding Models},
author = {José A. Pardo and Alicia Gómez-Pascual and José T. Palma and Juan A. Botía},
journal= {arXiv preprint arXiv:2506.13467},
year = {2025}
}
备注
16 pages, 3 figures, 1 table