DNA 嵌入的隐私性如何?逆转基石模型的基因序列表示
基因组学
2026-03-10 v1 人工智能
机器学习
摘要
DNA 基础模型已成为生物信息学和医疗保健领域的变革性工具。训练于庞大的基因组数据集,这些模型可用于生成序列嵌入,即捕获复杂基因信息的密集向量表示。这些嵌入正在通过嵌入即服务 (EaaS) 框架共享,以促进下游任务,同时据称保护底层原始序列的隐私。然而,随着这一实践变得更加普遍,这些表示的安全性正受到质疑。本研究评估了 DNA 基础模型对模型逆转攻击的韧性,即对手试图从模型输出中重建敏感训练数据的能力。在本研究中,模型用于重建 DNA 序列的输出为零样本嵌入,这些嵌入随后输入到解码器中。我们对三种 DNA 基础模型进行了隐私评估:DNABERT-2、Evo 2 和 Nucleotide Transformer v2 (NTv2)。我们的结果显示,按标记嵌入允许所有模型实现近乎完美的序列重建。对于平均池化嵌入,随序列长度的增加,重建质量会下降,但仍显著高于随机基线。Evo 2 和 NTv2 证明最为脆弱,特别是对于较短的序列,重建相似性可达 90% 以上,而 DNABERT-2 的 BPE 分词提供了最大程度的韧性。我们发现,嵌入相似性与序列相似性之间的相关性是重建成功的关键预测因子。我们的发现强调了在 EaaS 设置中广泛部署前,对基因组基础模型进行隐私敏感设计的紧迫性。训练代码、模型权重和评估管道已发布至:https://github.com/not-a-feature/DNA-Embedding-Inversion。
引用
@article{arxiv.2603.06950,
title = {How Private Are DNA Embeddings? Inverting Foundation Model Representations of Genomic Sequences},
author = {Sofiane Ouaari and Jules Kreuer and Nico Pfeifer},
journal= {arXiv preprint arXiv:2603.06950},
year = {2026}
}