通过随机乘积量化搭建连续表示与信息丰富离散表示之间的鸿沟
音频与语音处理
2025-11-11 v2
摘要
自监督学习(SSL)已成为语音处理中的核心技术,但其表示的高维度使得离散化对于提高效率至关重要。然而,现有的离散化方法仍存在显著的信息损失,导致其在与连续表示之间存在显著的性能差距。为克服这些限制,我们提出两种基于量化的离散化方法:乘积量化(PQ)和随机乘积量化(RPQ)。PQ 将原始特征空间划分为多个子空间,并独立量化每个子向量,产生一组保留来自不同子空间多样信息的离散单元,从而缓解单聚类量化所导致的损失。RPQ 通过随机采样固定比例的特征维度多次以构建子向量,从而更好地捕捉数据分布的变异性。理论分析表明,RPQ 降低了子量化器之间的相关系数 rho(其中 0 <= rho <= 1)。其量化误差下界为 rho 与 epsilon-kms 的乘积,其中 epsilon-kms 表示单个 K 均值量化器的量化误差。在由 LibriSpeech 和 ML-SUPERB 组成的数据集上的实验结果表明,PQ 和 RPQ 在 LibriSpeech 上的 WER 性能提升分别为 21.8% 和 20.0%,在 ML-SUPERB 上的 CER 性能提升分别为 24.1% 和 19.6%。此外,它们的性能与连续 SSL 表示相当,甚至在某些情况下优于连续表示。
引用
@article{arxiv.2504.04721,
title = {Bridging the Gap between Continuous and Informative Discrete Representations by Random Product Quantization},
author = {Xueqing Li and Hao Ma and Zehan Li and Rujin Chen and Boyu Zhu and Ruihao Jing and Jian Kang and Jie Li and Chi Zhang and Xiao-Lei Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2504.04721},
year = {2025}
}