中文

比较全部分fine调和预训练大型语言模型嵌入在Homo sapiens splice sites基组数据上的重建攻击

机器学习 2025-11-12 v1

摘要

本研究探讨了大型语言模型(LLM)应用于基因组序列时的嵌入重建攻击,具体关注微调对这些攻击的敏感性。建立在Pan等人展示预训练语言模型嵌入可泄露敏感信息基础上的工作,我们使用HS3D基因组数据集进行全面分析,确定任务特定优化是加强还是削弱隐私保护。我们的研究在三个方面扩展了Pan等人的工作:首先,我们将其重建攻击管道应用于预训练和微调模型嵌入,解决其方法论中未指定嵌入类型的关键缺口;其次,我们实现了专为DNA序列设计的特殊化标记机制,增强模型处理基因组数据的能力,因为这些模型是在自然语言上预训练的而非DNA;第三,我们进行详细的比较分析,检查预训练和微调嵌入在位置特异性、核苷酸类型和隐私变化方面的差异。我们评估了不同类型和维度的嵌入漏洞,为任务适应如何在基因组序列中转变隐私风险提供了更深入的见解。我们的发现显示,预训练和微调嵌入在重建漏洞方面存在明显区别。值得注意的是,微调在多个架构中(XLNet提升+19.8%,GPT-2提升+9.8%,BERT提升+7.8%)增强了对重建攻击的抵抗力,指向任务特定优化可能是一种潜在的隐私增强机制。这些结果凸显了为处理处理敏感基因组数据的语言模型需要更高级的保护机制的必要性,同时突显了微调作为潜在隐私增强技术的可探索性。

关键词

引用

@article{arxiv.2511.07481,
  title  = {Comparing Reconstruction Attacks on Pretrained Versus Full Fine-tuned Large Language Model Embeddings on Homo Sapiens Splice Sites Genomic Data},
  author = {Reem Al-Saidi and Erman Ayday and Ziad Kobti},
  journal= {arXiv preprint arXiv:2511.07481},
  year   = {2025}
}