中文

面向几何感知的音频编码的二维量化

声音 2026-05-19 v3 人工智能 信息论 机器学习 信号处理 math.IT

摘要

最近的神经音频编解码器在重建质量上取得了显著的进展,通常依赖于残差向量量化 (RVQ)、向量量化 (VQ) 和有限标量量化 (FSQ) 等量化方法。然而,这些量化技术限制了潜在空间的几何结构,使得更难捕捉特征之间的相关性,导致表示学习、码本利用和 token 速率方面的效率下降。本文引入了二维量化 (Two-Dimensional Quantization, Q2D2),这是一种将特征对投影到结构化二维网格(如六边形、菱形或矩形瓷砖)上并量化到最近网格值中的量化方案,生成由网格水平乘积定义的隐式码本,码本大小与常规方法相当。尽管其简单的几何表述,Q2D2 仍提高了音频压缩效率,低 token 速率和高码本利用率同时保持了最先进的重建质量。具体而言,Q2D2 在各种客观和主观重建指标上均实现了与或优于最先进模型的表现,经过大量在语音、音频和音乐领域的实验验证。更全面的消融研究进一步确认了我们设计选择的有效性。

关键词

引用

@article{arxiv.2512.01537,
  title  = {Two-Dimensional Quantization for Geometry-Aware Audio Coding},
  author = {Tal Shuster and Eliya Nachmani},
  journal= {arXiv preprint arXiv:2512.01537},
  year   = {2026}
}

备注

Accepted to ICML 2026