大生成模型辅助的说话人脸语义通信系统
信息论
2024-11-07 v1 机器学习
math.IT
摘要
生成式人工智能(AI)的快速发展不断揭示语义通信(SemCom)的潜力。然而,当前的说话人脸SemCom系统仍面临带宽利用率低、语义歧义和体验质量(QoE)下降等挑战。本研究提出了一种面向说话人脸视频通信的大生成模型辅助说话人脸语义通信(LGM-TSC)系统。首先,我们在发射端引入基于FunASR模型的生成语义提取器(GSE),将语义稀疏的说话人脸视频转换为信息密度高的文本。其次,我们基于大语言模型(LLM)建立私有知识库(KB),用于语义消歧和纠正,并辅以联合知识库-语义信道编码方案。最后,在接收端,我们提出生成语义重构器(GSR),利用BERT-VITS2和SadTalker模型将文本转换回与用户音色匹配的高QoE说话人脸视频。仿真结果证明了所提出的LGM-TSC系统的可行性和有效性。
引用
@article{arxiv.2411.03876,
title = {Large Generative Model-assisted Talking-face Semantic Communication System},
author = {Feibo Jiang and Siwei Tu and Li Dong and Cunhua Pan and Jiangzhou Wang and Xiaohu You},
journal= {arXiv preprint arXiv:2411.03876},
year = {2024}
}