中文

自我净化缓解多模态扩散语言模型中的后门

科普物理 2026-02-27 v1 广义相对论与量子宇宙学

摘要

多模态扩散语言模型(MDLMs)最近作为其自回归 counterparts 的竞争替代品而涌现。然而,这些模型对后门攻击的脆弱性仍未得到充分探讨。本文展示了经典数据投毒管道可成功植入后门到 MDLMs 中,从而通过特定触发器操控模型行为,同时保持对干净输入的正常性能。然而,针对这些模型有效的防御策略尚未出现。为弥合这一差距,我们引入一种名为 DiSP(Diffusion Self-Purification)的后门防御框架,用于 MDLMs。DiSP 的核心观察是:在推理时选择性屏蔽特定视觉标记可中和后门模型的触发器诱导行为并恢复正常功能。基于此,我们利用受感染的模型本身净化被投毒的数据集,然后在净化后的数据上进行微调以恢复为干净模型。鉴于这种特定设计,DiSP 能在无需额外模型或干净参考数据的情况下移除后门。大量实验表明,该方法有效缓解后门效应,将攻击成功率(ASR)从 90% 以上降至通常低于 5%,同时保持干净任务上的模型性能。

关键词

引用

@article{arxiv.2602.22245,
  title  = {Black holes and bits: A simple path to Bekenstein-Hawking entropy},
  author = {Jorge Pinochet},
  journal= {arXiv preprint arXiv:2602.22245},
  year   = {2026}
}

备注

6 pages, 3 figures