ViT2Hash:无监督保信息哈希
计算机视觉与模式识别
2022-01-17 v1
摘要
无监督图像哈希在不使用监督信息的情况下将图像映射为二进制码,是一种高压缩率的压缩器。因此,如何保留原始数据中有意义的信息是一个关键问题。受大规模视觉预训练模型 ViT(已在视觉表征学习上取得显著进展)的启发,本文提出一种简单的保信息压缩器,对 ViT 模型进行微调以适配目标无监督哈希任务。具体而言,从像素到连续特征,我们首先提出特征保持模块,以受损图像作为输入,从预训练 ViT 模型与完整图像中重建原始特征,使特征提取器聚焦于保留原始数据中的有意义信息。其次,从连续特征到哈希码,我们提出哈希保持模块,通过所提出的 Kullback-Leibler 散度损失来保留预训练 ViT 模型的语义信息。此外,加入量化损失与相似性损失以最小化量化误差。我们的方法非常简单,并在三个基准图像数据集上取得了显著更高的 MAP。
引用
@article{arxiv.2201.05541,
title = {ViT2Hash: Unsupervised Information-Preserving Hashing},
author = {Qinkang Gong and Liangdao Wang and Hanjiang Lai and Yan Pan and Jian Yin},
journal= {arXiv preprint arXiv:2201.05541},
year = {2022}
}