中文

面向移动AIGC的跨模态生成语义通信:联合语义编码与提示工程

网络与互联网体系结构 2024-04-23 v1

摘要

利用具有强大模型的大规模移动AIGC服务提供商(MASP),资源受限的最终用户可以访问高质量的AIGC服务。然而,这种被称为移动AIGC的进步也带来了一个重大挑战:用户需要从MASP下载大量的AIGC输出,导致巨大的带宽消耗和潜在的传输失败。在本文中,我们将跨模态生成语义通信(G-SemCom)应用于移动AIGC,以克服无线带宽限制。具体来说,我们利用一系列跨模态注意力图来指示用户提示与AIGC输出各部分之间的相关性。这样,MASP可以分析提示上下文并高效地过滤出语义最重要的内容。只传输语义信息,用户可以用其高质量地恢复整个AIGC输出,同时节省移动带宽。由于传输的信息不仅保留了语义,还提示了恢复,我们提出了一个联合语义编码和提示工程问题,以优化用户之间的带宽分配。特别地,我们提出了一个名为联合感知相似度和质量(JPSQ)的人类感知度量,它由两个基于学习的测量值融合而成,分别涉及语义相似度和美学质量。此外,我们开发了注意力感知深度扩散(ADD)算法,该算法学习注意力图并利用扩散过程来增强环境探索能力。大量实验表明,我们的方案平均可以减少移动用户49.4%的带宽消耗,且AIGC输出质量几乎没有感知差异。此外,ADD算法在总体奖励上比基线DRL方法高出1.74倍,表现出优越的性能。

关键词

引用

@article{arxiv.2404.13898,
  title  = {Cross-Modal Generative Semantic Communications for Mobile AIGC: Joint Semantic Encoding and Prompt Engineering},
  author = {Yinqiu Liu and Hongyang Du and Dusit Niyato and Jiawen Kang and Zehui Xiong and Shiwen Mao and Ping Zhang and Xuemin Shen},
  journal= {arXiv preprint arXiv:2404.13898},
  year   = {2024}
}