中文

CAP:通过提示生成检测生成模型中的未授权数据使用

机器学习 2024-10-10 v1

摘要

为了实现准确且无偏的预测,机器学习模型依赖于大规模、异质且高质量的数据集。然而,这可能会引发关于版权和授权方面的伦理与法律问题,尤其是在从互联网收集信息时。随着生成模型的兴起,追踪数据来源变得尤为重要,特别是因为它们可能(有意或无意地)复制受版权保护的内容。因此,本文提出了基于提示生成的版权审计框架,这是一种自动测试机器学习模型是否使用未授权数据进行训练的方法。具体来说,我们设计了一种生成合适密钥的方法,诱导模型揭示受版权保护的内容。为了证明其有效性,我们在四个物联网场景中收集的测量数据上进行了广泛的评估。结果表明,CAP在针对真实数据集和合成数据集时均表现出有效性。

关键词

引用

@article{arxiv.2410.05819,
  title  = {CAP: Detecting Unauthorized Data Usage in Generative Models via Prompt Generation},
  author = {Daniela Gallo and Angelica Liguori and Ettore Ritacco and Luca Caviglione and Fabrizio Durante and Giuseppe Manco},
  journal= {arXiv preprint arXiv:2410.05819},
  year   = {2024}
}