中文

WaveLLDM:面向语音增强与恢复的轻量化潜在扩散模型设计与实现

声音 2025-09-01 v1 人工智能 音频与语音处理

摘要

高质量音频在包括线上通信、虚拟助手以及多媒体行业在内的广泛应用场景中至关重要。然而,由于噪声、压缩及传输失真的影响,音频降质仍然是面临的主要挑战。虽然扩散模型在音频恢复中已证明有效,但通常需要大量计算资源且难以处理较长的缺失 segments。本研究引入 WaveLLDM(Wave Lightweight Latent Diffusion Model),一种集成高效神经音频编解码器于潜在扩散模型的架构,用于音频恢复与去噪。不同于传统方法在时域或谱域中进行处理,WaveLLDM 在压缩后的潜在空间中处理音频,既降低了计算复杂度,又保持了重构质量。基于 Voicebank+DEMAND 测试集的实证评估表明,WaveLLDM 能实现精准的谱重构,低 Log-Spectral Distance(LSD)分数(0.48至0.60),并对未见数据表现出良好的适应性。然而,尽管在感知质量和语音清晰度方面仍不及最先进方法,WB-PESQ 分数介于 1.62至1.71 之间,STOI 分数在 0.76至0.78 之间。这些局限性归因于架构调优不够、缺乏微调以及训练时长不足。尽管如此,融合神经音频编解码器与潜在扩散模型的灵活架构为后续发展奠定了坚实基础。

关键词

引用

@article{arxiv.2508.21153,
  title  = {WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration},
  author = {Kevin Putra Santoso and Rizka Wakhidatus Sholikah and Raden Venantius Hari Ginardi},
  journal= {arXiv preprint arXiv:2508.21153},
  year   = {2025}
}