量化全局自编码器:一种表示视觉数据的整体方法
计算机视觉与模式识别
2024-08-06 v2 机器学习
摘要
在量化自编码器中,图像通常被分割为局部块,每个块由一个token编码。这种表示方式在冗余,即使该区域的视觉信息内容不同,仍为每个区域消耗相同数量的token。自适应离散化方案如四叉树用于为大小不同的块分配token,但这仅变化token的影响区域,而该token本身仍然是局部描述符。现代体系结构在自编码器中添加注意力机制,使局部token获得一定程度的全局信息。尽管具有全局上下文,token仍与局部图像区域相关联。相反,我们的方法受到谱分解的启发,将输入信号转换为全球频率的叠加。在数据驱动的角度,我们学习对应VQ-VAE设置中码本条目的自定义基函数。此外,解码器以非线性方式组合这些基函数,超越谱分解的简单线性叠加。我们能够以高效的特征和通道之间的转置操作实现这种全局描述,并在压缩任务上演示了我们的性能。
引用
@article{arxiv.2407.11913,
title = {Quantised Global Autoencoder: A Holistic Approach to Representing Visual Data},
author = {Tim Elsner and Paula Usinger and Victor Czech and Gregor Kobsik and Yanjiang He and Isaak Lim and Leif Kobbelt},
journal= {arXiv preprint arXiv:2407.11913},
year = {2024}
}