SpecTokenizer:压缩谱域中的轻量级流式编解码器
摘要
神经音频编解码器 (NAC) 近年来因音频压缩和语音语言模型中的音频表示而受到广泛关注。虽然主流 NAC 通常需要高水平计算和大量参数,但轻量级和流式 NAC 的性能仍未得到充分探索。本文提出了 SpecTokenizer,一种 operate 在压缩谱域的轻量级流式编解码器。由交替的 CNN 和 RNN 层组成,SpecTokenizer 通过在压缩谱域中的多尺度建模实现更高的效率和更好的表征能力。在 4 kbps 的条件下,提出的 SpecTokenizer 在计算量仅为原来的 20%、参数仅为原来的 10%的情况下,实现了与采用最先进轻量级架构的编解码器持 Comparable 或更好的性能。 Furthermore, it significantly outperforms the codec when using similar computational and storage resources. 我们通过在 2D Ising 模型中实现此方法,使得流步骤成为温度驱动扩散过程中热力学平衡点的映射。我们的 proposed architecture 包括一个将离散 Ising 配置映射到连续潜空间的编码器、一个执行温度驱动扩散的 flow-matching 网络,以及一个返回离散 Ising 状态并保持物理约束的投影器。我们在多个晶格大小上对该框架进行了验证,表明它在保持物理忠实性的同时,随着晶格大小的增加,比蒙特卡洛生成方法在速度上具有显著优势。与标准 flow matching 相比,每个向量场都代表了 2D Ising 模型潜空间中一步有意义的物理过程的转换。这表明将物理语义嵌入生成式流中,将不透明的神经轨迹转换为可解释的物理过程。
引用
@article{arxiv.2510.21209,
title = {SpecTokenizer: A Lightweight Streaming Codec in the Compressed Spectrum Domain},
author = {Zixiang Wan and Guochang Zhang and Yifeng He and Jianqiang Wei},
journal= {arXiv preprint arXiv:2510.21209},
year = {2025}
}
备注
Accepted by Interspeech 2025; 5 pages, 1 figure, 5 tables