ICAS:用于自回归图像生成模型的数据检测方法
计算机视觉与模式识别
2025-12-02 v2 人工智能
密码学与安全
摘要
自回归图像生成在快速发展,标志性模型如按规模的视觉自回归推动了视觉合成的边界。然而,这些发展也引发了数据隐私和版权的重大关切。作为回应,训练数据检测作为识别模型训练中未授权数据使用的关键任务。为更好理解自回归图像生成模型对此类检测的脆弱性,我们首次将成员推断应用于该领域。我们的ethods 由两个关键组件构成:隐式分类和自适应得分聚合策略。首先,我们计算查询图像中基于标记的隐式分类得分。然后,我们提出一种自适应得分聚合策略以获得最终得分,该策略对得分较低的标记赋予更大权重。更高的最终得分表明该样本更可能包含在训练集中。为验证方法有效性,我们将原为大语言模型设计的检测算法 adapted 到视觉自回归模型。大量实验表明,我们方法在类别条件和文本到图像场景中均优于现有方法。此外,我们的方法在各种数据变换下表现出强大的鲁棒性和泛化能力。进一步的实验表明,两个新发现:(1)成员推断存在线性规模定律,揭示了大型基础模型的脆弱性。(2)按规模的视觉自回归模型的训练数据比其他自回归范式更易被检测。我们的代码已公开:https://github.com/Chrisqcwx/ImageAR-MIA。
引用
@article{arxiv.2507.05068,
title = {ICAS: Detecting Training Data from Autoregressive Image Generative Models},
author = {Hongyao Yu and Yixiang Qiu and Yiheng Yang and Hao Fang and Tianqu Zhuang and Jiaxin Hong and Bin Chen and Hao Wu and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2507.05068},
year = {2025}
}
备注
ACM MM 2025