面向边缘的高效语义图像通信用于交通监控
计算机视觉与模式识别
2026-04-15 v1 人工智能
网络与互联网体系结构
摘要
许多视觉监控系统受到严格的通信约束,传输完整分辨率的图像是不可行的,往往也没有必要。在此类场景下,视觉数据常用于对象存在、空间关系和场景上下文,而非像素级精确保真。本文提出两种交通监控用的语义图像通信管线,MMSD 与 SAMR,以降低传输成本同时保留有意义的视觉信息。MMSD(Multi-Modal Semantic Decomposition,多模态语义分解)目标是实现极高的压缩率并保证数据保密,因为敏感像素内容不会被传输。它将原始图像替换为紧凑的语义表示,即分割图、边缘图和文本描述,并利用扩散生成模型在接收端重建场景。SAMR(Semantic-Aware Masking Reconstruction,语义感知掩码重建)目标是在保持较强压缩率的同时实现更高的视觉质量。它根据语义重要性有选择地抑制非关键图像区域后再进行标准 JPEG 编码,并通过生成式图像填充恢复缺失内容。两种设计均遵循非对称的发送方-接收方体系结构,在边缘执行轻量级处理,在服务器上卸载计算密集型的重建工作。在树莱普斯 Pi~5 上,边缘端处理时间分别为 MMSD 约 15 秒,SAMR 约 9 秒。实验结果表明,MMSD 和 SAMR 分别实现了平均传输数据 reductions 的 99% 和 99.1%。此外,MMSD 在保持强语义一致性的同时,比最新基于 SPIC 的基准方案实现了更小的负载大小,而 SAMR 在相当条件下比标准 JPEG 和 SQ-GAN 提供了更好的质量-压缩权衡。
引用
@article{arxiv.2604.12622,
title = {Efficient Semantic Image Communication for Traffic Monitoring at the Edge},
author = {Damir Assylbek and Nurmukhammed Aitymbetov and Marko Ristin and Dimitrios Zorbas},
journal= {arXiv preprint arXiv:2604.12622},
year = {2026}
}