关于 Shumailov 等 (2024) 论文中 AI 模型在递归生成数据上训练崩溃现象的注记
机器学习
2024-10-28 v2 人工智能
摘要
Shumailov 等 (2024) 进行的研究表明, 反复对生成模型在合成数据上进行训练会导致模型崩溃。 该发现引发了广泛关注和讨论, 尤其是因为当前模型几乎耗尽了可用数据。 本文我们检讨拟合分布(通过核密度估计, 或 KDE) 或模型至数据的效果, 随后对其进行重复抽样。 我们旨在对 Shumailov 等 (2024) 观察到的现象进行理论理解。 我们的结果表明, 所报告的结果是一种统计现象,可能是不可避免的。
引用
@article{arxiv.2410.12954,
title = {A Note on Shumailov et al. (2024): `AI Models Collapse When Trained on Recursively Generated Data'},
author = {Ali Borji},
journal= {arXiv preprint arXiv:2410.12954},
year = {2024}
}
备注
Comment on https://doi.org/10.1038/s41586-024-07566-y