Stable Diffusion 作为分层 AI 生成图像压缩的天然跨模态解码器
图像与视频处理
2024-12-18 v1 计算机视觉与模式识别
摘要
人工智能生成内容(AIGC)的最新进展引起了广泛关注,同时伴随着传输和压缩海量 AI 生成图像(AIGI)的需求日益增长。然而,目前针对 AIGI 压缩方法的研究存在明显不足。为了填补这一关键空白,我们引入了一种可扩展的跨模态压缩框架,该框架包含多种人类可理解的模态,旨在高效捕获并传递 AIGI 的关键视觉信息。具体而言,我们的框架将图像编码为分层比特流,包括:通过文本提示传递高级语义信息的语义层;使用边缘或骨架图捕获空间细节的结构层;以及通过颜色图保留局部纹理的纹理层。该框架以 Stable Diffusion 作为后端,有效地利用这些多模态先验进行图像生成,当这些先验被编码时,它实际上充当了解码器。定性和定量结果表明,我们的方法能够熟练地恢复语义和视觉细节,在极低比特率(<0.02 bpp)下可与基线方法相媲美。此外,我们的框架无需完全解码即可支持下游编辑应用,从而为未来 AIGI 压缩研究开辟了新方向。
引用
@article{arxiv.2412.12982,
title = {Stable Diffusion is a Natural Cross-Modal Decoder for Layered AI-generated Image Compression},
author = {Ruijie Chen and Qi Mao and Zhengxue Cheng},
journal= {arXiv preprint arXiv:2412.12982},
year = {2024}
}