基于生成式潜在先验的容错语义语音通信
声音
2025-12-10 v1
摘要
无线网络上实时语音通信仍具挑战性,因传统信道保护机制在严格的带宽和时延约束下无法有效抵御数据包丢失。语义通信已成为通过联合源信道编码(JSCC)增强语音传输鲁性的有前景范畴。然而,其跨层设计致使实际部署受限,因其与现有数字通信系统不兼容。语音通信鲁性主要以对数据包丢失的容错性来评估。为此,我们提出Glaris——一种基于生成式潜在先验的鲁性语义语音通信框架,在生成式潜在空间中进行容错语音编码。生成式潜在先验使接收端能够进行高质量的数据包隐蔽(PLC),在语义一致性与重构保真度之间取得良好平衡。此外,设计了集成容错机制以抑制误差扩散并提升PLC效果。与传统数据包级前向纠错(FEC)策略相比,新方法在动态无线网络上实现更强鲁性,同时显著降低冗余开销。在LibriSpeech数据集上进行实验,表明Glaris持续优于现有容错编解码器,实现JSCC水平的鲁性,同时与现有系统无缝兼容,且在传输效率与语音重构质量之间取得 favorable 平衡。
引用
@article{arxiv.2512.08203,
title = {Error-Resilient Semantic Communication for Speech Transmission over Packet-Loss Networks},
author = {Zhuohang Han and Jincheng Dai and Shengshi Yao and Junyi Wang and Yanlong Li and Kai Niu and Wenjun Xu and Ping Zhang},
journal= {arXiv preprint arXiv:2512.08203},
year = {2025}
}
备注
submitted to IEEE in Nov. 2025