数据放大信息论极限
机器学习
2024-12-25 v1 机器学习
高能物理 - 实验
数据分析、统计与概率
摘要
近年来,生成式人工智能被用于创建支持科学分析的数据。例如,使用蒙特卡罗模拟输入训练生成对抗网络 (GAN),然后用于生成相同问题的数据。这具有显著降低计算时间的优势。N 个训练事件可导致 GN 个生成事件,其中增益因子 G 超过 1。这似乎违反了“信息不能白拿”的原则。这并非数据放大唯一的方式,本研究将其称为数据放大,并使用信息论概念加以研究。证明在保持数据信息内容不变的前提下,仍可实现增益大于 1 的情况。这导致一个仅取决于生成事件数与训练事件数的界限。本研究确定底层与重构概率分布的条件,以确保该界限。特别是,放大数据中变量的分辨率并未得到提升,但样本数量的增加仍可提高统计显著性。该界限通过计算机仿真及文献中 GAN 生成数据的分析得到验证。
引用
@article{arxiv.2412.18041,
title = {An information theoretic limit to data amplification},
author = {S. J. Watts and L. Crow},
journal= {arXiv preprint arXiv:2412.18041},
year = {2024}
}