中文

RU-AI:用于机器生成内容检测的大型多模态数据集

计算机视觉与模式识别 2025-02-19 v3 人工智能

摘要

最近的生成式 AI 模型在创建逼真且类似人类的内容方面的能力正在显著改变人们的交流、创作和工作方式。机器生成内容是一把双刃剑。一方面,当被恰当地使用时,它可以为社会带来益处;另一方面,它可能误导他人,构成对社会的威胁,尤其是在与人类创作的自然内容混合时。因此,有迫切需要开发有效的方法来检测机器生成的内容。然而,缺乏对齐的多模态数据集阻碍了此类方法的发展,尤其是在三模态设置(例如文本、图像和语音)方面。本文介绍了 RU-AI,一个用于检测文本、图像和语音中机器生成内容的大型多模态数据集。该数据集基于三个大型公开数据集:Flickr8K、COCO 和 Places205,通过添加其相应的 AI 副本,总计达 1,475,370 个实例。此外,我们创建了一个额外的噪声变体数据集,用于测试检测模型的鲁棒性。我们在数据集上使用当前的 SOTA 检测方法进行了大量实验。结果表明,现有模型在数据集上仍难以实现准确且稳健的检测。我们希望这个新数据集能够促进机器生成内容检测领域的研究, fostering(培育)负责任的生成式 AI 用法。源代码和数据集可在 https://github.com/ZhihaoZhang97/RU-AI 上获取。

关键词

引用

@article{arxiv.2406.04906,
  title  = {RU-AI: A Large Multimodal Dataset for Machine-Generated Content Detection},
  author = {Liting Huang and Zhihao Zhang and Yiran Zhang and Xiyue Zhou and Shoujin Wang},
  journal= {arXiv preprint arXiv:2406.04906},
  year   = {2025}
}

备注

Accepted by WWW'25 Resource Track