中文

训练数据归因:您的模型是否暗中训练了由您制造的数据?

计算机视觉与模式识别 2024-09-25 v1

摘要

text-to-image 模型的出现最近引发了广泛关注,但随之而来的潜在风险是可能侵犯用户条款。具体而言,一个对手可能利用由商业模型生成的数据来训练自己的模型,而无需获得proper authorization。为解决此风险,关键在于通过确定可疑模型的训练数据是否源自特定来源模型(完整或部分)来调查训练数据的归属。为追踪生成数据,现有方法需要在 source 模型的训练或推理阶段应用额外水印。然而,这些方法对已发布的预训练模型而言是不实用的,尤其是当模型所有者缺乏安全专业知识时。为解决这一挑战,我们提出了一种无需在 source 模型上进行额外修改的 text-to-image 模型注入式训练数据归因方法。该方法无需修改 source 模型即可识别可疑模型的训练数据是否源自 source 模型。我们方法的核心在于 text-to-image 模型的内在记忆特性。我们的核心洞见是,训练数据集的记忆会通过 source 模型生成的数据传递给在该数据上训练的模型,使得 source 模型和侵权模型在特定样本上表现出一致行为。因此,我们的方法涉及开发算法来揭示这些 distinct 样本,并将其用作内在水印来验证可疑模型是否源自 source 模型。我们的实验表明,该方法在识别可疑模型训练数据来源方面准确率超过 80%,且不干扰 source 模型的原始训练或生成过程。

关键词

引用

@article{arxiv.2409.15781,
  title  = {Training Data Attribution: Was Your Model Secretly Trained On Data Created By Mine?},
  author = {Likun Zhang and Hao Wu and Lingcui Zhang and Fengyuan Xu and Jin Cao and Fenghua Li and Ben Niu},
  journal= {arXiv preprint arXiv:2409.15781},
  year   = {2024}
}