保护生命之语:从 DNA 语言模型到蛋白质的可继承水印
基因组学
2025-09-24 v1
摘要
DNA 语言模型已彻底革新了我们理解和设计 DNA 序列——生命的基本语言——的能力,这种能力在治疗、合成生物学和基因编辑等应用中展现了前所未有的精度。然而,这种能力也带来了巨大的双刃剑风险,包括潜在的致病、病毒甚至生物武器的制造。为应对这些生物安全挑战,我们引入了两种创新的水印技术来可靠地追踪所设计的 DNA:DNAMark 和 CentralMark。DNAMark 通过同义密码子替换在 DNA 序列中嵌入水印,同时保持原始功能。CentralMark 进一步推进了此思路,通过利用蛋白质嵌入在 DNA 与翻译后蛋白质之间创建可继承水印,以确保贯穿中心 dogma 的检测。两种方法都利用语义嵌入生成水印逻辑,增强其对自然突变、合成误差和对抗攻击的鲁健性。在我们的治疗 DNA 基准测试上,DNAMark 和 CentralMark 在各种条件下均获得超过 0.85 的 F1 检测得分,同时保持与真实值的序列相似度超过 60%,退化分数低于 15%。对 CRISPR-Cas9 系统的案例研究凸显了 CentralMark 在实际场景中的实用性。这一工作为保障 DNA 语言模型提供了关键框架,在平衡创新与责任之间缓解生物安全风险。
引用
@article{arxiv.2509.18207,
title = {Securing the Language of Life: Inheritable Watermarks from DNA Language Models to Proteins},
author = {Zaixi Zhang and Ruofan Jin and Le Cong and Mengdi Wang},
journal= {arXiv preprint arXiv:2509.18207},
year = {2025}
}
备注
Accepted by NeurIPS 2025