中文

面向超低带宽语音通信的新型语义压缩方法

声音 2025-09-22 v1 音频与语音处理

摘要

现有语音音频编解码器在压缩上利用有限形式的时序冗余并允许多尺度表示,但倾向于以相同方式表示音频的所有特征。相反,近期为文本语音合成和语音转换任务设计的生成式语音模型最近在将音频信号分解为根本不同特征的高层语义表示方面取得了有效进展。本文利用此类表示提出一种新颖的语义通信方法,以在不牺牲感知质量或特定下游任务适合性的情况下实现更低的比特率。我们的技术在编码时压缩率降低 2-4 倍,匹配或超越现有音频编解码器在转录、情感分析和说话人验证方面的性能,尤其在感知质量和说话人验证方面使用最高可达 4 倍更低的比特率即可超越 Encodec。

关键词

引用

@article{arxiv.2509.15462,
  title  = {A Novel Semantic Compression Approach for Ultra-low Bandwidth Voice Communication},
  author = {Ryan Collette and Ross Greenwood and Serena Nicoll},
  journal= {arXiv preprint arXiv:2509.15462},
  year   = {2025}
}

备注

5 pages, 2 figures. This work has been submitted to the IEEE for possible publication