中文

用于科学数据压缩的稀疏$L^1$自编码器

机器学习 2024-05-24 v1 人工智能 数值分析 数值分析

摘要

科学数据集对机器学习驱动的压缩方法提出了独特挑战,包括对精度的更严格要求以及减轻潜在无效伪影。借鉴压缩感知和率失真理论的结果,我们通过开发使用高维潜在空间且经过L1L^1正则化以获得稀疏低维表示的自编码器,引入了有效的数据压缩方法。我们展示了如何利用这些信息丰富的潜在空间来减轻模糊和其他伪影,从而获得针对科学数据的高效数据压缩方法。我们在小角散射数据集上演示了我们的方法,表明它们可以实现约两个数量级甚至更好的压缩比。我们的压缩方法有望解决高性能分布式计算环境中传输、存储和分析方面的当前瓶颈。这对于处理全球共享实验设施产生的大量小角散射数据以支持科学研究至关重要。我们的方法为针对特定科学数据集获得专门压缩方法提供了通用途径。

关键词

引用

@article{arxiv.2405.14270,
  title  = {Sparse $L^1$-Autoencoders for Scientific Data Compression},
  author = {Matthias Chung and Rick Archibald and Paul Atzberger and Jack Michael Solomon},
  journal= {arXiv preprint arXiv:2405.14270},
  year   = {2024}
}

备注

11 pages, 6 figures