中文

通过过拟合掩码自编码器检测生成式鹦鹉学舌

机器学习 2024-06-21 v3 人工智能

摘要

生成式 AI 模型的出现彻底改变了数字内容创作,但由于生成式鹦鹉学舌(即模型过于紧密地模仿其训练数据),给维护版权完整性带来了挑战。我们的研究提出了一种新颖的方法来解决这一问题,该方法采用过拟合的掩码自编码器(MAE)来有效检测此类鹦鹉学舌样本。我们基于训练数据集上的平均损失建立检测阈值,从而能够精确识别修改后数据集中的鹦鹉学舌内容。初步评估显示出有前景的结果,表明我们的方法具有确保生成式模型的伦理使用和增强其法律合规性的潜力。

关键词

引用

@article{arxiv.2403.19050,
  title  = {Detecting Generative Parroting through Overfitting Masked Autoencoders},
  author = {Saeid Asgari Taghanaki and Joseph Lambourne},
  journal= {arXiv preprint arXiv:2403.19050},
  year   = {2024}
}

备注

Accepted to CVPR 2024, Responsible Generative AI workshop