中文

揭示身份保持模型中的属性错误绑定威胁

密码学与安全 2025-12-19 v1

摘要

身份保持模型在生成个性化内容方面取得了显著进展。不幸的是,当被滥用时,这类模型也加剧了风险,例如,通过生成针对特定个体的威胁性内容。本文介绍了属性错误绑定攻击,这是一种新颖的方法,通过诱导身份保持模型生成不安全(NSFW)内容来对其构成威胁。该攻击的核心思想是精心制作看似无害的文本提示以绕过文本过滤防护,并利用一个关键的模型漏洞:源于其内部注意力偏差的有缺陷的属性绑定。这导致有害描述被错误地归因于目标身份,并生成不安全输出。为了促进对此攻击的研究,我们提出了错误绑定提示评估集,该评估集从四个风险维度(色情、暴力、歧视和非法)检验当前最先进的身份保持模型的内容生成风险。此外,我们引入了属性绑定安全评分(ABSS),这是一个用于同时评估内容保真度和安全合规性的指标。实验结果表明,与现有的主流评估集相比,我们的错误绑定提示评估集在绕过五种领先的文本过滤器(包括 GPT-4o)方面成功率高出 5.28%,同时也展示了最高比例的不安全内容生成。所提出的 ABSS 指标通过同时评估内容保真度和安全合规性,实现了对身份保持模型更全面的评估。

关键词

引用

@article{arxiv.2512.15818,
  title  = {Unveiling the Attribute Misbinding Threat in Identity-Preserving Models},
  author = {Junming Fu and Jishen Zeng and Yi Jiang and Peiyu Zhuang and Baoying Chen and Siyu Lu and Jianquan Yang},
  journal= {arXiv preprint arXiv:2512.15818},
  year   = {2025}
}