面向几何感知的音频编码的二维量化
声音
2026-05-19 v3 人工智能
信息论
机器学习
信号处理
math.IT
摘要
最近的神经音频编解码器在重建质量上取得了显著的进展,通常依赖于残差向量量化 (RVQ)、向量量化 (VQ) 和有限标量量化 (FSQ) 等量化方法。然而,这些量化技术限制了潜在空间的几何结构,使得更难捕捉特征之间的相关性,导致表示学习、码本利用和 token 速率方面的效率下降。本文引入了二维量化 (Two-Dimensional Quantization, Q2D2),这是一种将特征对投影到结构化二维网格(如六边形、菱形或矩形瓷砖)上并量化到最近网格值中的量化方案,生成由网格水平乘积定义的隐式码本,码本大小与常规方法相当。尽管其简单的几何表述,Q2D2 仍提高了音频压缩效率,低 token 速率和高码本利用率同时保持了最先进的重建质量。具体而言,Q2D2 在各种客观和主观重建指标上均实现了与或优于最先进模型的表现,经过大量在语音、音频和音乐领域的实验验证。更全面的消融研究进一步确认了我们设计选择的有效性。
引用
@article{arxiv.2512.01537,
title = {Two-Dimensional Quantization for Geometry-Aware Audio Coding},
author = {Tal Shuster and Eliya Nachmani},
journal= {arXiv preprint arXiv:2512.01537},
year = {2026}
}
备注
Accepted to ICML 2026