中文

SurrogateSHAP:面向文本到图像模型的无训练数据贡献归因

机器学习 2026-02-02 v1 计算机视觉与模式识别

摘要

随着文本到图像(T2I)扩散模型在实际创意工作流程中的应用日益增多,建立一种原则性的框架来衡量提供数据集合中各贡献者的价值,对于公平补偿和可持续的数据市场至关重要。虽然Shapley值提供了一种以理论上严谨的方式进行归因的方法,但面临两个计算瓶颈:(i)由于需要对每个抽样子集(即数据贡献者)进行大量模型再训练,计算成本不可接受;(ii)由于贡献者之间存在相互作用,需估计的子集数量为组合数。为此,我们提出SurrogateSHAP,一个无需再训练的框架,通过从预训练模型进行推理来逼近昂贵的再训练博弈。为进一步提高效率,我们采用梯度提升树来逼近效用函数,并从基于树的模型中解析推导出Shapley值。我们在三个多样化的归因任务上评估SurrogateSHAP:(i)在CIFAR-20上对DDPM-CFG进行图像质量评估;(ii)在Post-Impressionist艺术品上对Stable Diffusion进行审美评估;(iii)在Fashion-Product数据上对FLUX.1进行产品多样性评估。在所有设置下,SurrogateSHAP在降低计算开销方面显著优于先前方法,始终能够在多个效用指标下识别出具有影响力的贡献者。最后,我们展示SurrogateSHAP能够有效定位导致临床图像中伪相关的数据来源,为审计安全关键的生成模型提供可扩展的路径。

关键词

引用

@article{arxiv.2601.22276,
  title  = {SurrogateSHAP: Training-Free Contributor Attribution for Text-to-Image (T2I) Models},
  author = {Mingyu Lu and Soham Gadgil and Chris Lin and Chanwoo Kim and Su-In Lee},
  journal= {arXiv preprint arXiv:2601.22276},
  year   = {2026}
}