中文

LatentBox:面向 AI 生成图像规模存储的潜在优先存储设计

分布式、并行与集群计算 2026-05-21 v2 数据库

摘要

AI 生成图像的爆炸式增长正在给存储基础设施带来可持续性挑战。像 Midjourney 和 Adobe Firefly 这样的平台已经托管了数十亿个生成图像,但传统的对象存储将它们持久化为像素级别的完整分辨率图像,消耗巨大的存储容量和带宽。与自然照片不同的是,AI 生成的图像可以从紧凑且模型原生的潜在张量中确定性地重建,这使得持久化图像存储从根本上是冗余的。本文提出了 LatentBox,一种用于 AI 生成图像的潜在优先存储系统。LatentBox 将压缩后的潜在表示视为可持久化的存储对象,并利用按需 GPU 重建于读取路径,以便以低成本的计算资源换取大规模的持久存储节省。我们的设计受到了我们所知最早的大规模 AI 生成图像访问分析的指导,该分析基于来自主要生成内容平台的 35 个月、20 亿请求的生产轨迹。针对该轨迹分析提出的建议,LatentBox 在快速命中方面保持频繁访问的图像的解码像素格式,将较少活跃的对象存储为压缩潜在表示,以扩大实际缓存容量,并持续调整图像与潜在缓存之间的划分,以优化用户感知的访问延迟。我们构建了一个 LatentBox 原型,并使用该生产轨迹进行评估。LatentBox 在持久存储方面减少了 78.7%,同时在纯基于图像的存储中实现了竞争甚至更低的平均和尾部延迟。

关键词

引用

@article{arxiv.2605.19385,
  title  = {LatentBox: Storing AI-Generated Images at Scale via a Latent-First Design},
  author = {Zirui Wang and Yunjia Zheng and Tingfeng Lan and Zhaoyuan Su and Haoran Ni and Juncheng Yang and Yue Cheng},
  journal= {arXiv preprint arXiv:2605.19385},
  year   = {2026}
}