中文

迈向理解生成式人工智能与互联网的相互作用

人工智能 2023-06-13 v1 计算机视觉与模式识别 机器学习

摘要

能够生成逼真图像或文本的 generative Artificial Intelligence (AI) 工具(如DALL-E、MidJourney或ChatGPT)的快速采用,已将这些技术的社会影响置于公共辩论的中心。这些工具之所以可行,得益于通过互联网公开可用的海量数据(文本与图像)。同时,这些生成式AI工具成为内容创作者,已在为训练未来模型可用的数据做出贡献。因此,未来版本的生成式AI工具将在人类创建与AI生成内容的混合数据上训练,导致生成式AI与公共数据存储库之间潜在的反馈回路。这一交互引发诸多问题:当在真实与AI生成数据混合上训练时,未来版本的生成式AI工具将如何表现?它们会随新数据集演化并改进,还是相反会退化?演化会引入偏差还是降低后续生成式AI工具的多样性?这些模型可能退化的社会影响是什么?我们能否缓解此反馈回路的影响?本文中,我们探究这一交互的影响,并报告使用经多种图像数据集训练的简易扩散模型的一些初步结果。我们的结果表明,生成图像的质量与多样性会随时间退化,意味着引入AI创建的数据会对生成式模型的未来版本产生不期望的影响。

关键词

引用

@article{arxiv.2306.06130,
  title  = {Towards Understanding the Interplay of Generative Artificial Intelligence and the Internet},
  author = {Gonzalo Martínez and Lauren Watson and Pedro Reviriego and José Alberto Hernández and Marc Juarez and Rik Sarkar},
  journal= {arXiv preprint arXiv:2306.06130},
  year   = {2023}
}