面向人脸图像压缩的可切换 Token-Specific 码本量化
计算机视觉与模式识别
2025-10-29 v2
摘要
随着视觉数据的不断增长,高效无损传输及其后续解释和理解已成为现代信息系统中的关键瓶颈。基于码本的解决方案利用全局共享码本对每个 token 进行量化和反量化,通过调整 token 数量或码本大小来控制 bpp。然而,对于充满属性的人脸图像,这些全局码本策略忽略了图像中特定于类别的相关性以及 token 之间的语义差异,尤其在低 bpp 水平时表现不佳。为此,我们提出了面向人脸图像压缩的可切换 Token-Specific 码本量化方法,该方法为不同图像类别学习独特的码本组,并为每个 token 分配独立的码本。通过记录每个 token 所属的码本组所需的少量比特,我们的方法可以在降低每个码本组大小时减少损失。这使得在较低的总体 bpp 下拥有更多的码本,从而增强了表征能力并提高了重建性能。凭借其通用设计,我们的方法可集成到任何现有的基于码本的表示学习方法中,并在人脸识别数据集上证明其有效性,在 0.05 bpp 时实现 93.51% 的平均准确率。
关键词
引用
@article{arxiv.2510.22943,
title = {Switchable Token-Specific Codebook Quantization For Face Image Compression},
author = {Yongbo Wang and Haonan Wang and Guodong Mu and Ruixin Zhang and Jiaqi Chen and Jingyun Zhang and Jun Wang and Yuan Xie and Zhizhong Zhang and Shouhong Ding},
journal= {arXiv preprint arXiv:2510.22943},
year = {2025}
}
备注
NeurIPS 2025 accepted