中文

数据放大信息论极限

机器学习 2024-12-25 v1 机器学习 高能物理 - 实验 数据分析、统计与概率

摘要

近年来,生成式人工智能被用于创建支持科学分析的数据。例如,使用蒙特卡罗模拟输入训练生成对抗网络 (GAN),然后用于生成相同问题的数据。这具有显著降低计算时间的优势。N 个训练事件可导致 GN 个生成事件,其中增益因子 G 超过 1。这似乎违反了“信息不能白拿”的原则。这并非数据放大唯一的方式,本研究将其称为数据放大,并使用信息论概念加以研究。证明在保持数据信息内容不变的前提下,仍可实现增益大于 1 的情况。这导致一个仅取决于生成事件数与训练事件数的界限。本研究确定底层与重构概率分布的条件,以确保该界限。特别是,放大数据中变量的分辨率并未得到提升,但样本数量的增加仍可提高统计显著性。该界限通过计算机仿真及文献中 GAN 生成数据的分析得到验证。

关键词

引用

@article{arxiv.2412.18041,
  title  = {An information theoretic limit to data amplification},
  author = {S. J. Watts and L. Crow},
  journal= {arXiv preprint arXiv:2412.18041},
  year   = {2024}
}