当 AI 自吞自化:AI 自食其身的局限性
机器学习
2024-11-11 v3 人工智能
摘要
生成式人工智能技术和大型模型正在跨越图像、文本、语音和音乐等多个领域产生逼真的输出。创建这些先进的生成模型需要大量资源,尤其是大规模高质量数据集。为最小化训练费用,许多算法开发者会使用由模型自身创建的数据作为经济实惠的训练解决方案。然而,并非所有合成数据都能有效提升模型性能,需在真实数据与合成数据的使用之间进行战略性平衡以优化结果。当前,人们曾受控地将真实数据与合成数据集成的方式正变得难以控制。合成数据的广泛且不受监管的在线传播导致了传统通过网页抓取整合的数据集被混入无标签的合成数据。这一趋势被称为 AI 自食其身现象,暗示生成式 AI 系统可能日益倾向于毫无辨别地消费自身产出,引发对模型性能、可靠性及伦理影响的广泛关注。如果生成式 AI 持续不加区分地自食其身,未来会是什么样子?我们应采取何种措施来缓解其潜在负面影响?为回答这些研究问题,本研究检阅了现有文献,探讨了 AI 自食其身的后果,分析了相关风险,并探讨了缓解其影响的策略。我们的目标是提供关于这一现象的全面视角,倡导在大型模型时代推动生成式 AI 技术的可持续发展。
引用
@article{arxiv.2405.09597,
title = {When AI Eats Itself: On the Caveats of AI Autophagy},
author = {Xiaodan Xing and Fadong Shi and Jiahao Huang and Yinzhe Wu and Yang Nan and Sheng Zhang and Yingying Fang and Mike Roberts and Carola-Bibiane Schönlieb and Javier Del Ser and Guang Yang},
journal= {arXiv preprint arXiv:2405.09597},
year = {2024}
}