中文

Re-Bottleneck: 神经音频自编码器的潜在结构重构

声音 2025-09-10 v2 机器学习 音频与语音处理

摘要

神经音频编解码器和自编码器已成为用于音频压缩、传输、特征提取和潜在空间生成的多功能模型。然而,一个关键的限制是,大多数模型都经过训练以最大化重建保真度,通常忽略了在不同下游应用中实现最佳性能所必需的特定潜在结构。我们提出了一个简单的、事后框架来解决这个问题,通过修改预训练自编码器的瓶颈。我们的方法引入了一个“Re-Bottleneck”,一个仅通过潜在空间损失进行训练的内部瓶颈,以灌输用户定义的结构。我们在三个实验中展示了该框架的有效性。首先,我们在不牺牲重建质量的情况下,对潜在通道施加排序。其次,我们将潜在变量与语义嵌入对齐,分析对下游扩散建模的影响。第三,我们引入等变性,确保输入波形上的滤波操作直接对应于潜在空间中的特定变换。最终,我们的Re-Bottleneck框架提供了一种灵活且高效的方式来定制神经音频模型的表示,使其能够以最小的额外训练无缝满足不同应用的各种需求。

关键词

引用

@article{arxiv.2507.07867,
  title  = {Re-Bottleneck: Latent Re-Structuring for Neural Audio Autoencoders},
  author = {Dimitrios Bralios and Jonah Casebeer and Paris Smaragdis},
  journal= {arXiv preprint arXiv:2507.07867},
  year   = {2025}
}

备注

Accepted at IEEE MLSP 2025