中文

基因组语言模型中的记忆与隐私风险量化

机器学习 2026-03-11 v1 密码学与安全 基因组学

摘要

基因组语言模型(GLMs)已涌现为学习DNA序列表征的强大工具,推动了变体预测、调控元件识别和跨任务迁移学习等领域的进展。然而,随着这些模型日益在敏感基因组队列上进行训练或微调,它们风险记忆特定训练数据的序列,引发严重的隐私、数据泄露和合规性问题。尽管对通用语言模型记忆风险的意识日益增长,但针对基因组领域的系统性评估仍稀缺,基因组数据具有固定的核苷酸字母表、强烈的生物结构以及个体可识别性等独特特征。我们提出了全面的多向量隐私评估框架,用于量化GLMs中的记忆风险。我们的方案整合了三种互补的风险评估方法:基于困惑度的检测、鸟 Canary 序列提取和成员推断。这些方法被整合为统一的评估管道,产生最坏情况的记忆风险评分。为实现可控评估,我们将鸟 Canary 序列以不同重复率植入合成数据集和真实基因组数据集,以精确量化重复率和训练动力学对记忆的影响。我们在多个GLM架构上评估该框架,考察序列重复率、模型容量与记忆风险之间的关系。我们的结果表明,GLMs确实表现出可测量的记忆现象,且记忆程度在不同架构和训练 regime 中呈现差异。这些发现表明,单一攻击向量无法捕捉记忆风险的全部范围,强调将多向量隐私审计作为基因组AI系统的标准实践的必要性。

关键词

引用

@article{arxiv.2603.08913,
  title  = {Quantifying Memorization and Privacy Risks in Genomic Language Models},
  author = {Alexander Nemecek and Wenbiao Li and Xiaoqian Jiang and Jaideep Vaidya and Erman Ayday},
  journal= {arXiv preprint arXiv:2603.08913},
  year   = {2026}
}

备注

13 pages