BadGraph:针对面向文本引导的图生成的潜在扩散模型后门攻击
机器学习
2026-04-24 v5 计算与语言
生物大分子
摘要
图生成的快速进步引发了新的安全担忧,尤其是关于后门漏洞。尽管先前工作探索了针对图像或无条件图生成模型的后门攻击,但针对条件图生成模型,特别是面向文本引导的图生成模型的后门攻击仍大多未被考察。本文提出 BadGraph,一种针对面向文本引导的图生成潜在扩散模型的后门攻击方法。BadGraph 利用文本触发器污染训练数据,暗中植入后门,在推理时当触发器出现时会诱发攻击者指定的子图,同时保持在干净输入上的正常性能。实验在四个基准数据集 (PubChem、ChEBI-20、PCDes、MoMu) 上表明该攻击的有效性和隐蔽性:仅 10% 的污染率即可实现 50% 的攻击成功率,24% 足以实现超过 80% 的成功率,同时对良性样本的性能几乎不受影响。消融研究进一步表明,后门是在 VAE 和扩散训练期间植入的,而非预训练阶段。这些发现揭示了面向文本引导的图生成潜在扩散模型中的安全漏洞,凸显了在药物发现等应用中的严重风险,并强调了需要针对此类扩散模型实施 robust 防御的必要性。
引用
@article{arxiv.2510.20792,
title = {BadGraph: A Backdoor Attack Against Latent Diffusion Model for Text-Guided Graph Generation},
author = {Liang Ye and Shengqin Chen and Jiazhu Dai},
journal= {arXiv preprint arXiv:2510.20792},
year = {2026}
}