为何压缩你能生成的东西?GPT-4o 生成如何usher in图像压缩领域
计算机视觉与模式识别
2025-05-01 v1
摘要
AIGC foundation 模型的快速发展彻底改变了图像压缩的范式,为放弃大多数像素级变换和编码方式铺平了道路,这促使我们不得不提出问题:如果 AIGC foundation 模型足够强大,就能仅凭一些紧凑的描述符(即文本或线索)就能忠实生成复杂结构和细粒细节,为何还要压缩这些图像呢?幸运的是,最近 OpenAI 的 GPT-4o 图像生成取得了惊人的跨模态生成、编辑和设计能力,这激励我们通过探索其在图像压缩领域的潜力来回答上述问题。在本工作中,我们研究了两种典型的压缩范式:文本编码和多模态编码(即文本 + 极低分辨率图像),其中通过 GPT-4o 图像生成功能生成而不是压缩来处理所有/大多数像素级信息。根本挑战在于如何在解码过程中保持语义和结构一致性。为克服这一困难,我们提出了一种结构栅格扫描提示工程机制,将图像转化为文本空间进行压缩,作为 GPT-4o 图像生成的条件。大量实验表明,我们设计的结构栅格扫描提示与 GPT-4o 图像生成功能的结合,在超低比特率下实现了令人瞩目的性能,进一步表明了 AIGC 生成在图像压缩领域的潜力。
引用
@article{arxiv.2504.21814,
title = {Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields},
author = {Yixin Gao and Xiaohan Pan and Xin Li and Zhibo Chen},
journal= {arXiv preprint arXiv:2504.21814},
year = {2025}
}