生成式人工智能(AI)与互联网的结合:走向演化还是退化?
计算机视觉与模式识别
2023-03-03 v1
摘要
在短短几个月内,能够生成逼真图像或文本的生成式人工智能(AI)工具迅速席卷互联网,成为有史以来采用速度最快的技术之一。其中一些生成式 AI 工具,如 DALL-E、MidJourney 或 ChatGPT,已获得广泛的公众知名度。有趣的是,这些工具之所以成为可能,是因为互联网上可用的大量数据(文本与图像)。这些工具在从互联网站点抓取的大规模数据集上训练。而现在,这些生成式 AI 工具正在产生大量新数据并注入互联网。因此,未来版本的生成式 AI 工具将在混合了原始数据与 AI 生成数据的互联网数据上训练。随着时间推移,原始数据与不同版本 AI 工具所生成数据的混合物将充斥互联网。这引发了若干引人深思的问题:当未来版本的生成式 AI 工具在真实与 AI 生成数据的混合体上训练时,它们将如何表现?它们会随新数据集演化还是退化?演化会在后续几代生成式 AI 工具中引入偏差吗?在本文中,我们探讨这些问题,并报告使用一个简单的图像生成 AI 工具得到的一些非常初步的仿真结果。这些结果表明,随着更多 AI 生成数据用于训练,生成图像的质量下降,从而暗示生成式 AI 可能发生退化。尽管这些结果尚属初步,且未经进一步研究不能推广,但它们有助于阐明生成式 AI 与互联网之间相互作用的潜在问题。
引用
@article{arxiv.2303.01255,
title = {Combining Generative Artificial Intelligence (AI) and the Internet: Heading towards Evolution or Degradation?},
author = {Gonzalo Martínez and Lauren Watson and Pedro Reviriego and José Alberto Hernández and Marc Juarez and Rik Sarkar},
journal= {arXiv preprint arXiv:2303.01255},
year = {2023}
}
备注
First version