中文

SoundSpring:具备双功能掩码语言模型的损失抗性音频信令器

音频与语音处理 2025-01-23 v1 声音 信号处理

摘要

本文提出了 "SoundSpring",一种创新的 error-抗性 audio transceiver,将联合源信源编码 (JSCC) 的鲁棒性优势与当前数字通信系统的兼容性相结合。不同于最近的深度 JSCC 信令器,这些信令器通过神经网络直接将音频信号映射到模拟信道输入符号,SoundSpring 采用分层架构,将音频压缩与数字编码传输分开,但充分利用大语言 (foundation) 模型的 in-context 预测能力。集成 casual-order mask 学习策略,单个模型在潜在特征域上运行,serve 双重功能:作为高效音频压缩器在发射端,以及在接收端作为有效的 packet loss concealment 机制。通过联合优化 audio compression 效率和 transmission error resiliency,结果表明 mask-learned 语言模型确实是强大的 contextual predictor,而我们的双功能压缩和隐蔽框架为将 foundation 语言模型应用于 audio communication 提供了新视角。通过大量实验评估,我们确立了 SoundSpring 在信号保真度指标和感知质量评分方面显著优于当代 audio transmission 系统。这些新发现不仅支持 SoundSpring 在基于学习的 audio communication 系统中的实际部署,也激发了开发未来 audio semantic transceiver 的思路。

关键词

引用

@article{arxiv.2501.12696,
  title  = {SoundSpring: Loss-Resilient Audio Transceiver with Dual-Functional Masked Language Modeling},
  author = {Shengshi Yao and Jincheng Dai and Xiaoqi Qin and Sixian Wang and Siye Wang and Kai Niu and Ping Zhang},
  journal= {arXiv preprint arXiv:2501.12696},
  year   = {2025}
}

备注

To appear in IEEE JSAC