中文

大语音模型赋能的语义通信

声音 2025-12-05 v1 人工智能

摘要

现有基于联合源信道编码(JSCC)架构的语音语义通信系统已展现出令人瞩目的性能,但其有效性仍受限于专为特定任务和数据集设计的模型结构。近期进展表明,在大规模数据集上预训练的生成式大模型可通过最少的微调在下游多样化任务中取得卓越性能。为利用大模型中嵌入的丰富语义知识并实现损失信道上的自适应传输,我们提出大语音模型赋能的语义通信(LargeSC)系统。同时实现自适应压缩和损失信道上的鲁棒传输仍具有挑战性,需要在压缩效率、语音质量和延迟之间进行权衡。在本工作中,我们采用Mimi作为语音编解码器,将语音转换为与现有网络架构兼容的离散令牌。我们提出一种自适应控制器模块,在带宽约束下实现自适应传输和带内不等错误保护(UEP),动态适应语音内容和丢包概率。此外,我们采用低秩适配(LoRA)对Moshi基础模型进行微调,以生成式方式恢复丢失的语音令牌。仿真结果表明,所提出的系统支持从550 bps到2.06 kbps的带宽范围,在高丢包率下语音质量优于传统基线,且端到端延迟约为460 ms,展示了其实时部署的潜力。

关键词

引用

@article{arxiv.2512.04711,
  title  = {Large Speech Model Enabled Semantic Communication},
  author = {Yun Tian and Zhijin Qin and Guocheng Lv and Ye Jin and Kaibin Huang and Zhu Han},
  journal= {arXiv preprint arXiv:2512.04711},
  year   = {2025}
}

备注

15 pages, 9 figures