面向超低比特率视觉通信与分析的生成式语义编码
计算机视觉与模式识别
2025-11-03 v1 人工智能
摘要
我们考察了在通信带宽极低的极端场景(如深空探索、战场情报、复杂环境中的机器人导航)下的超低比特率视觉通信问题,旨在支持远程视觉分析和人类交互。在此基础上,我们提出关键问题:是否可以在不牺牲视觉分析精度和人类交互性能的前提下,使用现有编码方法中的极小比特率即可准确重建视觉场景?现有文本到图像生成模型为超低比特率图像描述提供了新思路,但仅能实现视觉场景的语义层级近似,对视觉通信、远程视觉分析和人类交互而言仍远不足够。为此,我们提出将图像生成与深度图像压缩无缝集成,通过联合文本和编码潜在表示引导修正流模型(rectified flow models)实现视觉场景的精确生成。语义文本描述和编码潜在表示均在极小比特率下编码并传输至解码器。实验结果表明,我们的方法在使用大幅降低的带宽情况下,能够实现与现有方法相同的图像重建质量和视觉分析精度。代码将在论文接受后公开。
引用
@article{arxiv.2510.27324,
title = {Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis},
author = {Weiming Chen and Yijia Wang and Zhihan Zhu and Zhihai He},
journal= {arXiv preprint arXiv:2510.27324},
year = {2025}
}