语言导向的语义潜在表示用于图像传输
物理与社会
2024-05-17 v1 适应与自组织系统
摘要
在语义通信(SC)的新范式中,关注点是通过从原始数据中提取语义信息来传递意义本身。近期数据到文本模型的进展促进了语言导向的SC,特别是通过图像到文本(I2T)编码和文本到图像(T2I)解码实现文本转换图像通信。然而,尽管语义对齐,文本过于粗糙,难以精确捕获空间位置、颜色和纹理等细致视觉特征,导致预期图像与重建图像之间存在显著的感知差异。为解决这一限制,本文提出一种新型语言导向SC框架,同时传输文本和压缩后的图像嵌入表示,并利用潜在扩散模型对其进行融合,以重建预期图像。实验结果验证了该方法的潜力,在噪声通信信道下仅传输原始图像大小的 2.09%,即可实现更高的感知相似性,而基线SC方法仅通过文本传输则表现较差。代码已公开于 https://github.com/ispamm/Img2Img-SC/。
引用
@article{arxiv.2405.09978,
title = {Pedestrian evacuations with imitation of cooperative behavior},
author = {Amir Zablotsky and Marcelo N Kuperman and Sebastián Bouzat},
journal= {arXiv preprint arXiv:2405.09978},
year = {2024}
}