无线深度语音语义传输
声音
2022-11-07 v1 信息论
音频与语音处理
math.IT
摘要
本文提出了一类用于无线信道端到端语音传输的高效语义编码传输新方法。我们将整个系统命名为深度语音语义传输(DSST)。具体而言,我们引入非线性变换将语音源映射至语义隐空间,并将语义特征送入信源-信道编码器以生成信道输入序列。在变分建模思想指导下,我们在隐空间上构建熵模型以估计语义特征嵌入之间的重要性差异。据此,不同重要性的语义特征可被合理分配不同的编码速率,从而最大化系统编码增益。此外,我们引入信道信噪比(SNR)自适应机制,使得单一模型可应用于多种信道状态。我们模型的端到端优化带来了灵活的率失真(RD)权衡,支持多用途的无线语音语义传输。实验结果验证,我们的 DSST 系统在客观与主观指标上均明显优于当前工程化的语音传输系统。与现有神经语音语义传输方法相比,我们的模型在达到相同质量时最多节省 75% 的信道带宽开销。音频演示的直观对比可见 https://ximoo123.github.io/DSST。
引用
@article{arxiv.2211.02283,
title = {Wireless Deep Speech Semantic Transmission},
author = {Zixuan Xiao and Shengshi Yao and Jincheng Dai and Sixian Wang and Kai Niu and Ping Zhang},
journal= {arXiv preprint arXiv:2211.02283},
year = {2022}
}