中文

DIS-CO:发现 VLM 训练数据中的版权内容

计算机视觉与模式识别 2025-06-03 v3 人工智能 机器学习

摘要

在无法直接访问训练数据的情况下,如何验证大型视觉语言模型(VLM)的训练过程是否使用了版权内容?基于 VLM 能够识别其训练语料库中图像的假设,我们提出了 DIS-CO,一种用于推断模型开发过程中是否包含版权内容的新方法。通过使用目标版权材料中的特定帧反复查询 VLM,DIS-CO 通过自由形式的文本补全提取内容的身份信息。为了评估其有效性,我们引入了 MovieTection,这是一个由 14,000 帧图像及配对详细描述组成的基准测试数据集,这些图像取自模型训练截止日期前后发行的电影。我们的结果表明,DIS-CO 显著提升了检测性能,在具有可用 logits 的模型上,将先前最佳方法的平均 AUC 提高了近一倍。我们的发现还强调了一个更广泛的问题:所有测试的模型似乎都在一定程度上接触过版权内容。我们的代码和数据可在 https://github.com/avduarte333/DIS-CO 获取

关键词

引用

@article{arxiv.2502.17358,
  title  = {DIS-CO: Discovering Copyrighted Content in VLMs Training Data},
  author = {André V. Duarte and Xuandong Zhao and Arlindo L. Oliveira and Lei Li},
  journal= {arXiv preprint arXiv:2502.17358},
  year   = {2025}
}