基于学习自动机的 PromptLA:面向黑箱文本到图像扩散模型的完整性验证
计算机视觉与模式识别
2025-03-31 v2 人工智能
密码学与安全
摘要
尽管文本到图像(T2I)扩散模型在合成质量方面取得了显著进展,但其黑箱部署带来了显著的监管挑战:恶意行为者可以通过参数操控来微调这些模型,以生成非法内容,规避现有安全措施。因此,验证 T2I 扩散模型的完整性至关重要。鉴于生成模型输出中的随机性以及与之交互的高成本,我们通过生成图像特征分布之间的 KL 散度来辨别模型被篡改的痕迹。我们提出了一种基于学习自动机(PromptLA)的新颖提示选择算法,用于高效准确的验证。在四个先进 T2I 模型(如 SDXL、FLUX.1)上的评估表明,我们的方法在完整性检测中实现了超过 0.96 的平均 AUC,超过基线方法 0.2 以上,显示出强大的有效性和泛化能力。此外,我们的方法成本更低,且对图像级后处理具有鲁棒性。就本文而言,这是首个解决 T2I 扩散模型完整性验证的工作,为实际中的 AI 版权诉讼建立了可量化的标准。
引用
@article{arxiv.2412.16257,
title = {PromptLA: Towards Integrity Verification of Black-box Text-to-Image Diffusion Models},
author = {Zhuomeng Zhang and Fangqi Li and Chong Di and Hongyu Zhu and Hanyi Wang and Shilin Wang},
journal= {arXiv preprint arXiv:2412.16257},
year = {2025}
}
备注
9 pages, 6 figures