中文

如何使用 ViTScore 度量评估图像语义通信?

计算机视觉与模式识别 2024-04-23 v2 人工智能 信息论 math.IT

摘要

语义通信(SC)有望成为一种新范式,推动下一代通信的变革,其主要关注点从准确的比特传输转向通信中有效的语义信息交换。然而,先前广泛使用的图像度量不适用于评估 SC 中的图像语义相似性。测量两幅图像之间相似性的经典度量通常依赖于像素级或结构级,例如 PSNR 和 MS-SSIM。直接采用计算机视觉(CV)领域中一些基于深度学习的定制度量,如 LPIPS,对于 SC 是不可行的。为此,受自然语言处理(NLP)领域中 BERTScore 的启发,我们提出了一种评估图像语义相似性的新度量,称为视觉 Transformer 分数(ViTScore)。我们从理论上证明 ViTScore 具有 3 个重要性质,包括对称性、有界性和归一化,这使得 ViTScore 便于且直观地用于图像度量。为评估 ViTScore 的性能,我们通过 4 类实验将 ViTScore 与 3 种典型度量(PSNR、MS-SSIM 和 LPIPS)进行比较:(i)通过图像描述下游 CV 任务评估与 BERTScore 的相关性,(ii)经典图像通信中的评估,(iii)图像语义通信系统中的应用评估,以及(iv)受语义攻击的图像语义通信系统中的评估。实验结果表明,ViTScore 在评估图像语义相似性方面稳健且高效。特别地,在评估由语义攻击(如利用生成对抗网络(GANs)进行图像逆变换)引起的图像语义变化方面,ViTScore 优于其他 3 种典型度量。这表明 ViTScore 在 SC 场景中部署时是一种有效的性能度量。

关键词

引用

@article{arxiv.2309.04891,
  title  = {How to Evaluate Semantic Communications for Images with ViTScore Metric?},
  author = {Tingting Zhu and Bo Peng and Jifan Liang and Tingchen Han and Hai Wan and Jingqiao Fu and Junjie Chen},
  journal= {arXiv preprint arXiv:2309.04891},
  year   = {2024}
}